OECD人工智能能力人工智能评估人工智能教育教育政策未来技能通用人工智能

OECD人工智能能力指标简介

2026年8月24日•约 122 分钟

Abstract / 摘要

“OECD 以人类心理学为参照,用九项能力指标和五级量表比较人工智能与人类能力,说明截至 2024 年 11 月的 AI 水平、测量局限,以及指标在就业、教育和 AGI 讨论中的政策用途。”

资料来源: OECD (2025), Introducing the OECD AI Capability Indicators, OECD Publishing, Paris. DOI: 10.1787/be745f04-en

前言

Andreas Schleicher (OECD Director for Education and Skills)
我们对人工智能(AI)的发展及其对整个社会的影响了解得还远远不够。在教育领域,虽然关于人工智能如何改变教育方式的讨论甚多,但我们对人工智能如何重新定义学生应学习哪些内容以有效补充其能力的了解却知之甚少。如果公共政策的目标不仅仅是事后被动地根据每一个新推出的人工智能工具来调整课程和教学系统,那么就必须积极主动地预判人工智能能力的演进方向。
本报告提出了一种实现这一目标的方法论。该方法论围绕人类能力的关键维度,提供了一套指标,用以描述人工智能向全面等同于人类的方向发展的情况。这些指标涵盖以下方面:语言、社会互动、问题解决、创造力、元认知与批判性思维、知识、学习与记忆、视觉、操作能力以及机器人智能。每项指标均按五个等级划分,AI系统最难以实现的能力位于等级的高端。该方法基于人类心理学,为人工智能的发展提供了一种结构化的、高层次的分析视角。
将人工智能能力与人类能力联系起来,有助于政策制定者评估人工智能在教育中的潜在作用。例如,人工智能在多大程度上能够模仿教师工作中至关重要的社会交往能力?因此,人工智能在哪些方面可以替代或补充教师的不同任务?而当人工智能能力提升到下一个等级时,又会带来怎样的影响?
这些指标将使各国教育部长能够就人工智能对教育未来的影响展开讨论——从课程设计到教学法。这其中包括如何在教育中配置空间、时间、人力、技术与关系,以营造一种面向未来的学习环境,使学习者为他们的未来做好准备,而不是仅仅延续我们的过去。
除了教育领域,这些指标还为部长们提供了一个框架,用以讨论人工智能对其他领域的影响:就业、公民参与、休闲活动以及日常生活。在所有这些领域,政策制定都需要面向未来,而非停留在过去。

执行摘要

自2022年11月ChatGPT推出以来,人工智能(AI)对人类活动的潜在影响开始引起广泛关注。然而,尽管人工智能发展迅速,公众对其影响的理解却未能同步提升。关于人工智能如何可能改变人类活动,仍有大量工作需要深入探讨。
本报告介绍了经合组织新推出的人工智能能力指标。该指标旨在为政策制定者提供一个基于证据的框架,以理解人工智能能力并将其与人类能力进行比较。该指标经过五年时间开发,汇聚了广泛的人工智能研究人员、心理学家及其他专家的智慧。配套技术报告(OECD,2025[1])的章节由32位专家撰写,并由另外25位专家审阅。
这九项指标涵盖了一系列人类能力,每项指标均描述了人工智能向完全等同于人类能力发展的过程,包括:语言、社会互动、问题解决、创造力、元认知与批判性思维、知识、学习与记忆、视觉、操作能力以及机器人智能。指标采用五级量表呈现,最具挑战性的人工智能能力位于量表的高级别。每个级别都简要描述了该水平的人工智能系统能够准确且稳定执行的能力类型。当前人工智能在各指标上的表现评级均基于现有的证据。
这些指标以测试版形式发布,诚邀两大关键利益相关群体——人工智能研究人员和政策制定者——提供反馈。研究人员的人工智能评估工作为指标提供了实证支持,而政策制定者能够解读并利用这些指标的洞见,对制定明智政策至关重要。同时,我们也欢迎其他利益相关群体的反馈意见。经合组织将在收集利益相关方反馈并制定系统化更新机制后,发布首个正式版本的指标。

结论

  • 作为一个对公众负责的政府间组织,经合组织具备独特优势,能够在人工智能评估领域发挥领导作用,借助其在国际技能比较评估中的经验,为全球社会提供权威结果。
  • 经合组织的方法论利用现有证据,制定出既反映最新研究成果又便于非技术人员理解的人工智能能力指标,描绘了人工智能能力向完全等同于人类能力的演进过程。
  • 报告介绍了源自人类心理学的九项人工智能能力指标,这些指标由经合组织的人工智能与未来技能团队及50多位外部专家共同开发。
  • 指标通过五级量表展示,描述了人工智能系统向人类能力等同进展所需涵盖的多维度任务。每项指标的级别均有实证支持,目前人工智能系统的能力水平大多处于第2级至第3级之间。
  • 这些指标可用于描绘人工智能向满足工作所需人类能力的进展。将指标与职业和任务要求对应,并进行“差距”分析,可作为分析特定职业在人工智能帮助或替代部分任务后如何演变的起点。指标还可引发基于价值观的讨论,探讨在整个经济中各级能力应如何应用于不同职业。
  • 指标同样有助于深入理解人工智能对教育的影响。它们为识别人工智能可能推动教育变革的领域提供了框架,有助于明确哪些教学任务可能被重塑,哪些学习目标需要演变。虽然指标不涉及价值判断,但突出显示了教育内容与目的在技术上可实现转变的领域,为未来课程设计、教师角色和学生能力的讨论提供参考。

参考文献

  • OECD (2025), AI and the Future of Skills Volume 3: The OECD AI Capability Indicators, OECD Publishing. [1]
  • OECD (2024), “Explanatory memorandum on the updated OECD definition of an AI system”, OECD Artificial Intelligence Papers, No. 8, OECD Publishing, Paris, https://doi.org/10.1787/623da898-en. [2]

第1章 当前人工智能能力概览

经合组织教育研究与创新中心(CERI)下的“人工智能与未来技能(AIFS,AI and the Future of Skills)”项目提出了一个框架,用以系统地衡量人工智能(AI)和机器人能力,并将其与人类技能进行比较。本章概述了人工智能在经合组织人工智能能力指标各领域的表现。第一部分介绍了一张对比表格,并提供了理解该表格所需的信息。表格显示了截至2024年11月,人工智能在各领域的当前水平及最先进人工智能系统所具备的能力类型。表格下方的简要评述解释了经合组织专家组对人工智能系统该水平评级的理由,以及推动人工智能系统进阶至下一水平所需具备的能力。

当前人工智能能力对比表

表1.1展示了最先进人工智能(AI)系统当前能力的概览。每个领域中人工智能系统所处的当前水平,印在对应能力描述的旁边,描述了该水平下人工智能系统具备的能力类型。表格下方的评述简要说明了经合组织专家组为何将人工智能系统评定为该水平,以及推动人工智能系统向量表下一水平发展的能力要求。
经合组织开发了五级量表,用以以非专业人士易于理解的方式传达人工智能能力的进展。该量表旨在涵盖所有类型的人工智能系统。目前的评级涵盖了狭义符号人工智能系统、神经符号系统、大型语言模型(LLMs)、社交代理以及在特定领域处于前沿的机器人系统。量表的一端,一级代表当前人工智能系统早已解决且毫无争议的简单能力方面;另一端,五级人工智能系统能够复制对应人类能力的所有方面。中间的三个等级则展示了人工智能在不同性能方面向完全人类等效能力发展的过程。
经合组织在第二章以及配套的技术报告(OECD,2025[1])中详细阐述了其开发该量表的方法。人工智能系统的评级反映了截至2024年11月的最新技术水平。
要被评定为某一特定等级,人工智能系统必须持续且可靠地具备该等级描述的大部分能力。例如,我们的专家将大型语言模型(LLMs)置于语言能力量表的第二级和第三级之间的临界点。LLMs具备第三级描述的许多语言能力方面,但由于其无法进行严密的分析推理、容易产生错误信息(幻觉),且缺乏动态学习能力,因此受到限制。然而,鉴于LLMs在该等级的大部分语言能力方面表现良好,故其被评定为第三级。
当前人工智能系统的一个突出缺陷——大型语言模型(LLMs)中持续存在的“幻觉(hallucination)”问题——在各个能力量表中以多种方式直接或间接表现出来。知识、学习与记忆量表指出,“幻觉”问题将在第五级得到解决;语言量表也指出,批判性思维将在第五级出现;而元认知与批判性思维量表则指出,知识的批判性评估将在第三级出现。量表之间的这种差异反映了在预测解决这一挑战难度上的不同视角;这一方面在未来版本中可能需要进行协调。然而,量表的一个重要功能是提醒公众,幻觉只是众多挑战中的一个:人工智能要达到人类水平的表现,还需要解决多个挑战。
读者会注意到,我们的专家将当前所有人工智能水平评定在第2级和第3级,这实际上是我们构建首版能力量表方法的一个间接结果。该量表旨在传达每项能力从过去的发展到一个假想的未来——即人工智能能够复制该能力的所有人类方面。在每个量表中,级别描述列出了该领域的主要发展阶段。已经实现的阶段位于较低级别,而尚未实现的则位于较高级别。第4级和第5级通常描述的是人工智能仍难以持续且可靠地执行的能力方面。
许多领域的研究人员可能不同意我们对2024年技术现状的评判,或对五级能力量表中能力分布的看法。经合组织鼓励人工智能研究人员与组织联系,协助我们更新量表,使其更好地与最新进展保持一致。
本章中的等级描述为简略版;各等级及其对应量表的完整版本详见第3章。
表 1.1 当前人工智能能力水平概览
领域等级 (1-5)能力描述
语言3处于该水平的人工智能系统能够可靠地理解并生成语义意义,运用多语料库知识。它们表现出高级的逻辑推理和社会推理能力,能够处理文本、语音和图像。系统支持多种语言,并通过迭代学习技术实现适应性提升。
社会互动2人工智能系统能够组合简单动作来表达情感,并通过交互学习以应对未来的情况。它们能够回忆事件,并根据经验进行一定程度的调整,识别基本信号,并通过语调和上下文检测情绪。系统还能够感知个体差异,并将过去的经验应用于反复出现的挑战。
问题解决2人工智能系统将定性推理(如空间或时间关系)与定量分析相结合,解决以传统领域抽象方式构建的复杂专业问题。它们能够处理多种定性状态及其转变,预测系统随时间可能的演变或变化。
创造3人工智能系统能够生成与其训练数据显著不同且具有价值的输出,突破传统界限。它们能够将技能推广应用于新任务,并跨领域整合不同的思想。
元认知和批判性思维2人工智能系统能够监控自身的理解水平,并相应调整处理方法。它们能够处理可能存在歧义的熟悉信息,需要运用适度的信心和有根据的猜测。系统还能够通过辨别已知与未知信息来应对部分不完整的信息。
知识,学习和记忆3人工智能系统通过分布式表示学习信息的语义,并能推广到新的情境。它们可以处理庞大的数据集以实现上下文敏感的理解,但缺乏实时学习能力。
视觉3人工智能系统能够处理目标物体外观和光照的一些变化,执行多个子任务,并应对已知的数据和情境变异。
操作能力2人工智能系统能够处理各种物体形状和中等柔性的材料,在受控环境中操作,环境中杂乱程度低至中等。它们能够绕过开放空间中的小障碍物,适应在限定区域内随机放置的物体,并在无时间限制的情况下完成任务。
机器人智能2机器人系统在部分已知、基本静态的半结构化环境中运行,环境具有一定的明确定义的变异性。它们执行短期、简单的多功能任务,这些任务虽然定义明确,但存在内在不确定性。它们能够进行有限的人机交互,如使用最小化界面,并能在熟悉的任务环境中应对一些意外情况。机器人系统处理的伦理问题较少或几乎没有。

当前评级评论

语言

如上所述,当前最先进的大型语言模型(LLM),例如 ChatGPT 所使用的GPT-4o(OpenAI,2024a[2]),被评定为第三级的较低门槛水平。大型语言模型在获取世界知识、支持多语言处理以及通过微调和后处理进行迭代学习方面表现出色。然而,由于其无法进行严密的分析推理且容易产生错误“幻觉”信息,导致推理能力不够稳健,这仍然是其进一步发展的瓶颈。

社会互动

GPT-4o及同类大型语言模型在社交互动维度上被评为第二级,主要因为它们具备较强的社交记忆能力。然而,这些模型没有具体的身体形态,缺乏身份感知,并且社交感知能力有限。像索尼的AIBO这样的社交机器人同样属于第二级系统,但它们具备不同的能力。这些机器人具有具体的身体形态,具备基本的感知和身份识别能力,但其解决问题的能力远不如大型语言模型系统。

问题解决

符号人工智能系统在狭窄领域(如物流规划和模型检验)表现出超越人类的能力,因此被评为第二级系统。尽管大型语言模型能够满足某些三级要求,例如解决用自然语言描述的问题,但由于出现幻觉问题,它们的表现仍然较为脆弱。我们的专家认为,这一点在2024年底发布的早期“推理”模型,如GPTo1(OpenAI, 2024b[3])的预览版本中依然成立。关于更先进的“推理”模型,如GPTo3(OpenAI, 2025[4])和DeepSeek R1 V3(DeepSeek-AI, 2025[5]),是否仍存在该问题,已在OECD人工智能能力指标的完整版中进行了分析。

创造

当前的人工智能系统能够创造出对人类有价值、在一定程度上具有新颖性且偶尔令人惊讶的成果。三级系统的一个例子是谷歌的AlphaZero(Silver 等,2017[6]),该系统利用神经符号架构为问题产生了高效且出人意料的策略。大型语言模型依赖概率架构和训练数据(即先前人类生成的内容),这意味着它们无法生成与现有人类知识显著不同的输出。然而,这些输出通常是有用的且偶尔具有新颖性,因此大型语言模型属于典型的二级系统。

元认知和批判性思维

最先进的大型语言模型通常在元认知与批判性思维量表上表现为二级水平。它们能够监控自身的理解并调整处理当前问题的方法。然而,它们在整合陌生信息和评估自身知识方面存在困难,这两者都是三级系统所要求的。在评估时,具备代理能力的系统通常也处于二级,反映出人工智能在自我监控和自适应调节自身推理能力方面的持续局限。2025年发布的代理系统将会在下一版经合组织能力指标中进行评审。

知识,学习和记忆

大型语言模型(LLMs)及相关生成式人工智能是该领域的前沿系统,通过如从存储知识中泛化等能力达到三级水平。尽管在这一领域已有针对AI智能体的努力,但尚无系统表现出达到四级所需的能力,例如通过与世界的互动进行增量学习或对知识空白的元认知觉察。

视觉

前沿的人工智能视觉系统处于三级水平。我们的专家识别出少数具备有限四级能力的系统,但这些系统的性能尚不够稳定,尚无法获得该评级。三级系统能够稳健地处理有限范围的数据类型,并能应对目标物体在光照、形状和外观上的适度变化。与四级系统不同,目前的人工智能视觉系统无法基于自我反馈提升性能,也无法应对光照和目标物体的较大变化。

操作能力

操作系统被评为二级。典型的最先进系统是在高度受控的制造环境中使用的机械臂。相比之下,三级系统能够在中等杂乱和动态的环境中操作形状、尺寸和重量各异的物体。操作系统距离达到人类水平仍有很大差距。然而,只要物体和环境可以标准化——例如在工厂中——这些系统仍会影响人类的工作岗位,并对技能需求产生影响。

机器人智能

最先进的机器人系统是自主配送机器人和工业自动化系统,专家将其评为二级。这些系统在结构化环境中执行预定义任务表现良好。目前,机器人系统尚无法可靠地完成多步骤任务或与人类协作,而这正是达到三级所必需的能力。

参考文献

第2章 构建衡量人工智能能力的框架

经合组织教育研究与创新中心(CERI)下属的“人工智能与未来技能(AIFS,AI and Future of Skills)”项目提出了一个框架,用以系统性地衡量人工智能(AI)和机器人技术的能力,并将其与人类技能进行比较。本章介绍了经合组织为制定本报告中所呈现的测试版指标所采用的方法论。该框架展示了这些指标如何为政策制定者提供清晰、基于证据的洞见,帮助他们理解人工智能的发展及其对社会、工作和教育的影响。经合组织还指出,这些指标为衡量通用人工智能(AGI)进展提供了一个有原则、审慎的框架。为此,该框架为政策制定者提供了必要的工具,使其能够独立验证科技领导者和研究人员关于人工智能进展的各类主张。

人工智能的发展已超出我们对其能力的理解

根据不同的来源,人工智能(AI)要么将拯救世界,要么将摧毁它。在一个被炒作与恐惧主导的舆论环境中,关于人工智能真实能力的清晰、可靠且有深度的信息仍然极其缺乏。即便是人工智能的开发者,也并不真正了解当前系统的能力,或其进步的速度。作为一个独立且具有权威性的国际组织,经济合作与发展组织(OECD)具备独特优势来填补这一知识空白。OECD借助其在比较评估方面的丰富经验、与顶尖计算机科学家和工程师的广泛合作,以及其国际化的视角,开发出了一套独特的方法论,能够提供严谨、有据可依且清晰明了的人工智能现实表现分析框架。这一框架为政策制定者提供了他们迫切需要的清晰认知,以应对日益复杂的技术环境,并制定具有前瞻性的战略。
自2022年ChatGPT问世以来,人工智能与机器人技术迅速发展,全球政策制定者也日益意识到评估其能力的必要性。例如,欧盟的《人工智能法案》(EUR-Lex,2024[1])明确要求定期监测人工智能系统的能力。与此同时,经济合作与发展组织(OECD)理事会的《人工智能建议书》(OECD Legal Instruments,2024[2])以及即将在2025年举行的巴黎人工智能峰会(La Maison Élysée,2025[3])也都强调了深入理解人工智能对就业市场影响的重要性。
尽管人们对人工智能的关注不断增加,但一个长期存在的问题依然未解:目前尚无一套系统性的框架,能够既全面评估人工智能能力,又兼具可理解性与政策相关性。为填补这一空白,经济合作与发展组织(OECD)开发出一套用于评估人工智能能力的框架,并推出了其初步版本的人工智能能力指标(beta版)(见图2.1,了解指标开发过程的概览)。OECD制定的这一指标体系旨在满足以下几个目标:
(1)可理解性——以直观明了的方式传达人工智能的优势与局限。
(2)政策相关性——提供有关人工智能对教育、就业和经济影响的洞察。
(3)全面性——涵盖人工智能能力的所有关键方面。
(4)响应性——通过系统性更新,持续追踪人工智能的发展进展。
图2.1 OECD人工智能能力指标的发展过程
图2.1 OECD人工智能能力指标的发展过程 2020 2025 AIFS 项目启动 OECD AI 能力分类体系开发 » 传统经济研究采用基于任务的方法 » 基于能力的方法能更结构化、 更高层次地理解 AI 发展 » 分类体系扎根于人类心理学, 便于比较人类能做什么和不能做什么 OECD AI 指标开发 » 捕捉 AI 从简单任务到复杂任务的进展 » 区分具有质变意义的突破 » 有意义地区分 AI 表现与人类表现 同行评审过程验证 OECD AI 指标发布 › 语言 › 社会互动 › 问题解决 › 创造力 › 元认知与 批判性思维 › 知识、记忆 与学习 › 视觉 › 操作能力 › 机器人智能 完善并建立系统化的 更新流程……
将人工智能能力与人类能力相联系,使政策制定者能够评估人工智能在教育、工作和日常生活中的潜在作用。现有的一些人工智能能力框架(如 MLCommons〔MLCommons,2025[4]〕和斯坦福大学的《AI指数》〔Maslej 等,2025[5]〕)主要依据基准测试结果来描述能力,而没有将其与人类能力进行比较。单独来看,基准测试的结果对于非人工智能专家而言难以理解,甚至对人工智能研究人员来说,也不清楚这些结果与人工智能系统在现实世界中执行任务的能力之间有何关系。
在讨论当前人工智能基准测试的局限性时,2025年《AI指数》报告的作者指出:“要真正评估人工智能系统的能力,需要更为严格和全面的评估方法”(Maslej 等,2025[5])。经合组织(OECD)提出的框架独具特色,它试图将人工智能的能力与劳动市场中所需的整个人类能力范围进行比较,并认识到在许多情况下,尚缺乏可用于评估高水平能力的人工智能基准测试。该指标体系提供了一个概念框架,用于识别或开发能够系统评估人工智能在与生活和就业相关的人类技能领域中能力的测试方法。
那些仅基于人工智能基准测试成绩、而不以人类能力为参照的框架,面临着迅速被人工智能发展所超越的风险。而以人类能力为基础构建评估人工智能能力的框架还有一个附加好处:人类能力在时间上相对稳定。换句话说,该框架即便在人工智能快速进步的背景下,也能保持稳定性和参考价值,直到人工智能真正超越人类在所有能力维度上的表现为止。
Anthropic 的《AI经济指数》(Handa 等,2025[6])采用了一种新颖的方法,通过将 Claude.ai 的能力与部分人类任务相对应,来分析人工智能发展对经济的影响。该方法基于对数百万次 Claude 大型语言模型(LLMs)与用户之间互动的分析,这些互动中包含了可映射至 O*NET 职业信息网络中任务的内容。然而,该方法的局限在于,它仅聚焦于基于聊天的语言模型交互分析。因此,并未试图将人工智能的表现与职业中所涉及的整个人类能力范围进行比较。相比之下,经合组织(OECD)开发的 AI 能力指标体系,旨在系统性地衡量 AI 在所有关键人类能力领域中的表现。经合组织利用该指标体系来分析人工智能发展对职业的影响,具体方法详见本报告的第4章。
鉴于当前框架的局限性,经合组织以测试版形式发布这些指标,欢迎人工智能和人类心理学领域的专家共同合作。下文所展示的人工智能系统评级于2024年11月最终确定,因此反映了当时的技术现状。未来的改进将进一步增强这些指标,使其成为一个精准且灵敏的工具,用于追踪人工智能的发展动态。
本章介绍了制定这些指标的动机及其构建方法(见图2.1,指标开发概览)。同时,本章也承认了在同行评审过程中发现的测试版量表的局限性。有关方法论的更详细讨论,请参见随本报告一同发布的技术专著(OECD, 2025[7])。本章最后探讨了政策制定者如何利用这些指标,帮助解答因人工智能快速发展而产生的相关问题。
第2章介绍了全部九个量表、各级别的性能描述以及对最先进AI系统的评级。每个指标还包括对各领域重要测量内容的讨论以及现有的AI性能证据。
第3章则提供了更具体的案例,展示研究人员和政策制定者如何利用这些量表,进行基于证据的分析,以评估AI对劳动力和教育系统的影响及其相关意义。

方法论:一种新颖且独特的方法

从任务到能力:评估人工智能的新方法。理解人工智能对社会的影响,不仅仅是评估其是否能够完成特定的工作或任务。虽然基于任务的分析在劳动经济学中占据核心地位,但将其应用于人工智能时,常常缺乏清晰性和连贯性;大多数人类任务涉及多种相互关联的能力。
近年来,经济学文献从基于职业的人工智能对工作的影响分析,转向基于任务的分析。这一转变认识到,职业是由多个任务组成的,而任何特定的人工智能技术或其他技术对这些任务的影响可能截然不同。基于任务的方法成为劳动经济学研究中的一项重大创新(Autor, Levy 和 Murnane, 2023[8])。然而,该方法未能提供一个清晰的框架来描述人工智能的发展。首先,任务分类体系难以理解,因为现代经济中存在成千上万甚至数万个不同的工作任务;相比之下,基本能力的数量相对较少。其次,单个任务通常需要多种技能,而这些技能可能会被不同的人工智能技术或其他技术以截然不同的方式影响。因此,基于任务的方法未能为传达人工智能的关键进展或局限性提供清晰的框架。
经济合作与发展组织(OECD)则采用了基于能力的框架,将关注点从零散的具体任务转向核心的人类能力,如推理、语言、社会互动和心理运动技能。该方法以人类心理学为基础,提供了一个结构化且高层次的视角来观察人工智能的发展。为了展示人工智能在整个人类能力范围内的发展情况,OECD开发了九个人工智能能力指标,如图2.2所示。
图2.2 OECD人工智能能力指标
图2.2 OECD人工智能能力指标

构建与开发指标

构建五级评分量表

经合组织(OECD)与30名计算机科学家、心理学家及评估专家核心团队合作,开发了全面的指标体系。这些指标能够体现人工智能从简单任务到复杂任务的发展进程,区分具有质的飞跃的关键突破,并提供有意义的视角,以便将人工智能的能力与人类能力进行比较和理解。
经合组织(OECD)设计了包含五个等级的量表,用以表示人工智能系统在完成任务时难度的逐步增加(见图2.3)。这些量表旨在涵盖所有类型的人工智能和机器人系统。在当前版本的量表中,狭义符号型人工智能系统、神经符号系统、大型语言模型(LLMs)、社交代理以及机器人系统均被纳入考虑,覆盖了不同人工智能子领域中针对不同能力的工作。在每个量表中,等级1代表已解决的人工智能挑战(例如谷歌搜索的检索能力),而等级5则代表能够模拟对应人类能力所有方面的表现。
图2.3 人工智能五个等级概览
图2.3 人工智能五个等级概览
经合组织(OECD)制定五级量表的主要动机,是以一种外行也能理解的方式传达人工智能能力的进展。每个量表通常包含多个维度,反映人工智能在不同难度层面的表现。这些等级由明确的质的差异标志,而不仅仅是性能的逐步提升。每个指标都明确标识了当前人工智能系统在该五级量表上的表现水平。
理想情况下,每个能力量表都应由正式测试支持,且该测试能够提供AI系统和人类的可比结果,但目前许多领域尚无此类测试。经合组织(OECD)因此利用现有的各种证据,并结合专家判断来弥补空白。这些证据不仅包括正式测试,还可能涵盖竞赛结果或对个别AI系统表现的分析。专家参与则用于批判性评估现有测试的相关性和解释,确保性能声明有坚实的证据基础。国际学生评估项目(PISA)和成人能力国际评估项目(PIAAC)等标准化人类评估偶尔被用来评估AI,但它们的主要价值在于启发设计新的AI测试,以更好地反映与AI系统相关的人类能力全貌。
未来,能力量表可能会扩展涵盖超出人类能力范畴的AI表现,这些表现被称为AI性能的“质的超人类”特征。这与“量的超人类”表现形成对比:后者指的是AI在速度、准确性或数据覆盖等方面优于人类,但执行的任务本质上是人类也能完成的。超人类能力的概念并非AI所独有,历史上显微镜、计算器和动力工具等创新也使人类能够超越自然极限完成任务。然而,AI引发了新的问题,即涉及智能行为的能力,而不仅仅是机械或计算优势。

验证指标

该过程历时五年发展,于2024年底进行了结构化的同行评审。评审由来自人工智能、心理学和教育领域的25名研究人员组成,分为以下两类:
  • 全面评审者 — 评估框架的全面性
  • 领域专长评审者 — 在各自专业领域内评估具体的指标尺度
专家反馈推动了指标的不断完善,形成了当前的测试版(beta版本)。未来版本将整合更多证据,规范测量方法,并提升政策相关性。经合组织期待来自AI研究者、心理学家、教育专家和经济学家的更多意见,以进一步完善这些测试版指标。

将AI表现度量指标关联起来

将 AI 性能度量与各个能力等级尺度关联的目标,是确定 AI 在某一时间点上,在哪个等级上表现出稳健且可靠的能力。各等级按难度递增排列。因此,当 AI 被评定在某一等级时,意味着它能够稳健且可靠地模拟该能力等级内所有方面的表现。然而,由于设计上的限制,具体的 AI 系统可能在某些能力方面存在缺失。能力尺度反映的是整体技术的最新发展水平,而非单个系统的具体限制。
部分能力等级尺度指出,在狭窄应用中表现出的低级能力,可能难以整合进具备通用性能的系统中。最低级别对应已解决的问题,AI 通常在这些方面表现出数量上的超人能力——即以比人类更快、更准确的方式完成任务。中间级别通常有标准化的基准测试,而高级别则涵盖了当前 AI 系统仍难以应对的新兴或尚未充分评估的能力方面。即使缺乏坚实的性能测量,专家们也为这些高级别提供了估计。

局限性

评估人工智能的一个主要挑战在于,不同能力领域的测量工具分布不均。语言和视觉等领域已有数十年的基准测试,而社交互动和创造力等领域则缺乏正式评估。在这些情况下,专家判断被用来填补空白。
尽管尚无完全系统的人工智能评估框架,但该方法汇集了现有证据,突出未来发展的关键领域。指标仍处于测试版本阶段,计划通过与研究人员和专家的合作不断完善。
AI能力指标测试版为理解人工智能的能力与局限提供了宝贵基础,但推动该框架的进步需要更广泛专家社区的深入协作。下一步的关键工作包括:
  • 扩展覆盖范围: 纳入更多能力与指标,以更全面地反映人工智能的能力范围。
  • 优化结构设计: 在基准测试中确保一致性,纳入多智能体系统的考量,并处理能力之间的重叠问题。
  • 明确人类能力基准: 在需要的情况下提供更一致的基准,或有意地区分平均人类与专家水平,以反映AI与人类之间在难度认知上的有意义差异,因为不同量表在与人类平均或专家水平的比较中存在差异。
  • 实现动态更新: 建立定期审查流程,并维护一个性能测量的资料库,以及时反映AI的快速进展。
通过将人工智能的能力与人类核心能力对齐,OECD的指标体系为评估人工智能对社会的影响,尤其是在工作与教育等领域,提供了一个透明且具有政策相关性的工具。尽管该框架仍在不断完善中,但它标志着朝着更加系统、循证地理解AI发展迈出的关键一步。关于该指标体系的开发方法及其局限性的更详细讨论,请参阅本报告随附发布的技术卷(OECD, 2025[7])。

下一步

在对测试版指标进行充分完善之后,OECD计划开展进一步的工作,以确保这些指标能够持续响应人工智能的发展。这些后续工作还将致力于协助AI研究人员设计并实施有效且具有信息价值的人工智能能力测试。

定期更新

经合组织(OECD)将实施一个定期更新的循环机制。这一机制将包括以下几个方面:监测与能力等级量表相关的现有AI基准测试中AI性能的提升;追踪科学文献,以识别应当纳入能力等级量表的新基准测试;并将所有结果综合为有关AI当前能力水平的说明。这些更新将通过OECD的AI研究人员与心理学家网络进行审议。OECD计划在2025年剩余时间内开发更新的方法论,并于2026年初开展首次更新。

预见AI的突破

到目前为止,OECD 主要专注于开发对已有文献中已展示的 AI 当前能力的描述。为了拓展指标在理解 AI 影响方面的潜在价值,OECD 将制定一种方法来预测可能的突破。为此,OECD 将邀请专家组分析该领域的关键研究计划,描述潜在突破与指标之间的关系。目标是分析当前 AI 所缺乏的能力相关研究,了解哪些能力可能即将迎来性能上的突破。OECD 计划于 2026 年开展首次将指标与 AI 突破联系起来的工作。

专家调查

为了补充专家判断,OECD 将开发一项正式的周期性专家调查,审查并提供关于 AI 能力关键陈述的反馈,该调查参照芝加哥大学经济专家小组(Clark Center for Global Markets, 2025[9])的模式。该调查将定期更新当前公共基准尚未评估的 AI 能力方面。这项调查还能及早发现新的研究开始聚焦于此前领域难以解决的 AI 能力。OECD 计划于 2025 年招募专家组成员,2026 年启动该专家小组,并将按照芝加哥模式每月开展调查。

新的基准测试与竞赛

为了提供有关 AI 能力发展更完整的信息,OECD 将确定量表上基准测试和竞赛目前尚不充分的具体等级。这些等级反映了应当重点监测的领域,以便及时识别新的 AI 能力何时有望实现重大突破。长期目标是开发一套新的测试项目,能够为这些缺失的 AI能力等级提供独立且权威的基准测试结果,从而向公众充分传达 AI 发展的情况。OECD 计划于 2026 年举办首次研讨会,讨论适合开展新测试或竞赛的候选等级,并识别现有的评估方法。随后将在 2027 年启动初步的评估开发工作。

AI能力指标的作用

OECD的指标为政策制定者提供了一种基于证据的工具,以便用非技术人员能够理解的方式评估人工智能的发展。这一认知对于推动诸如欧盟《人工智能法案》和 OECD 人工智能建议等重大政策举措具有特别重要的价值。

利用AI能力指标预测其对教育、工作和社会的影响

随着人工智能系统能力的不断提升,随之而来的新问题也愈加突出——例如,何时以及如何对其进行信任、部署或限制。指标有助于明确哪些层级的人工智能表现可能引发伦理或安全方面的担忧,比如在缺乏责任追究的情况下做出决策,或在战争、医疗等高风险领域展现自主性。
除了伦理层面,这些指标还为分析人工智能能力与人类工作的需求匹配情况提供了实用工具。这使得我们能够识别出更易受到自动化影响的职业,并预测更广泛的经济影响。虽然指标并不预测人工智能是否会取代人类工作者,但它们揭示了人工智能在技术上能够执行哪些关键任务,从而推动对经济、监管或伦理障碍的深入分析。
在教育领域,指标为人工智能在教学中的应用以及学生未来所需技能的发展提供了重要洞见。随着人工智能能够完成越来越复杂的任务,教育系统必须考虑哪些能力对人类仍然至关重要——无论是出于实用、认知还是内在价值的原因——并探讨如何培养未来一代,使其能够在日益强大的人工智能环境中茁壮成长。

制定和衡量通用人工智能的框架

经合组织(OECD)人工智能能力指标为定义和衡量通用人工智能(AGI)提供了一个潜在的框架。AGI通常被理解为能够匹配人类认知和社会能力全方位的人工智能。尽管许多人认为AGI仍遥遥无期,但一些科技领袖和研究人员警示其即将到来及潜在的存在性风险。在此背景下,亟需明确且基于证据的监测工具。
现有对超人类AGI的定义尝试多依赖于对人类能力的抽象描述,这些描述在实际中难以量化。例如,谷歌DeepMind将超人类AGI系统定义为“在所有任务中表现超越100%人类”的系统(Morris 等,2024[10])。相比之下,OECD的人工智能能力指标提供了一个系统化的框架,用以在整个人类能力领域中比较AI的发展与人类表现,从而提供对AI能力和局限的有意义描述,无需政策制定者直接解读AI测试结果。
这点尤为重要,因为AI能力在不同领域的提升速度可能存在显著差异。大型语言模型(LLM)能力的发展被描述为“锯齿形前沿”(Dell’Acqua 等,2023[11]),其在某些领域(如事实知识广度)表现较为先进,而在另一些领域(如形式推理)则相对有限。未来的AI进展,包括假设中的AGI系统,也很可能呈现类似的特征。能够追踪与人类能力相关领域的优势与劣势,对于绘制AI进步带来的社会、经济和政治影响图谱至关重要。
该指标体系允许政策制定者系统性地跟踪AI的进展,五级表现(level 5)覆盖所有能力尺度时,可能成为衡量人类水平通用智能的基准。通过捕捉诸如创造力、推理和元认知等高级AI能力,这一框架帮助缩小公众关切与技术现实之间的差距。在五级表现尚未实现的情况下,潜在的“AGI级别”风险能够基于实证证据而非推测进行权衡,从而支持更加稳健且面向未来的政策响应。

支持相关方参与AI能力指标的应用

随着时间推移,OECD计划使这些指标成为各国政府、学术研究人员和产业界的全球参考标准。实现这一目标将涉及以下几个关键策略:
  • 可用性与推广: 开发互动式格式和可搜索数据库,使广泛的利益相关者能够轻松利用这些指标。
  • 实用工具: 提供定量和定性资源(例如职业小案例),展示新兴的人工智能能力将如何改变工作场所和教育环境。
  • 系统性跟踪: 收集政策、商业和研究领域的多样化应用案例,建立一个便于访问的现实应用知识库。
  • 持续的利益相关者参与: 吸引专家、从业者和政策制定者参与指标的完善,促进广泛采用和协同改进。
这些策略的最终目标是确保OECD人工智能能力指标能够弥合技术评估与可行政策之间的鸿沟。通过全面衡量人工智能的能力,政府和利益相关者能够更准确地预见新兴人工智能技术的利弊,从而采取负责任且有依据的措施,推动可持续的创新驱动型增长(MLCommons,2025[4])。

参考文献

第3章 OECD人工智能能力指标

经济合作与发展组织(OECD)教育研究与创新中心(CERI)下的“人工智能与未来技能(AIFS,AI and Future of Skills)”项目提出了一个框架,用于系统性地衡量人工智能(AI)和机器人能力,并将其与人类技能进行比较。本章介绍了OECD的AI能力指标,该指标目前涵盖九个领域的AI能力水平描述及其与人类技能的对比:语言、社交互动、问题解决、创造力、元认知与批判性思维、知识、学习与记忆、视觉、操作能力和机器人智能。OECD以测试版形式发布这些指标,旨在体现其认识到,持续与AI研究人员和人类心理学家的互动是建立更稳固共识和确保指标对AI领域快速发展的响应性的必要条件。

1 语言能力量表(Language scale)

Yvette Graham, Arthur Graesser and Swen Ribeiro
语言是人类的重要能力,为许多认知任务提供基础。人工智能(AI)在语言领域的广泛研究使计算机能够理解、解释和生成自然语言。这一点在近年来广受关注的大型语言模型(LLMs)中体现得尤为明显。由于语言在众多的人类活动中占据重要地位,语言表现的界限难以明确定义。基于人工智能研究者所关注的应用范围,语言能力量表采取了广泛的定义,涵盖了涉及语言的多样化任务中的多个关键方面。

重要的是测量什么?

作者确定了评估人工智能系统整体语言能力的六个关键维度。第一个维度涉及语言本身所编码的意义,包括词汇、语法、语义、话语和风格。第二和第三个维度涉及语言使用的其他关键特征:模式(口头或文本,理解或生成)以及涵盖的语言数量。剩余三个维度则关注语言系统潜在的语言相关任务范围:访问知识的能力、对知识进行推理的能力 以及学习能力。随着整体规模水平的提升,每个维度都呈现出从初级到复杂的进阶发展。

现有证据

数千项测试用于评估人工智能在语言方面的表现。该综述抽样了约40类常用于构建该领域的任务中的一半,包括问答、翻译和对话系统。每个领域均考虑了一个或多个由研究人员共同开发的主要基准或“共享任务”,用于衡量表现并跟踪及促进进展。这些任务的当前表现通常对应于量表的某一水平。然而,随着人工智能表现的提升,共享任务难度增加时,具体水平可能发生变化。该量表指示了大致对应每个水平的典型任务类型。技术报告中提供了每种抽样任务的具体测试的显著示例。

当前人工智能水平

当今最先进的大型语言模型(如ChatGPT所使用的模型)大致处于3级水平。大型语言模型擅长访问世界知识,但由于其是预训练的非自适应模型,在推理、学习以及处理细微语言差异和/或通信物理模式方面存在困难。与旨在成为多任务通用系统的生成式人工智能系统不同,非生成式人工智能系统排名较低。后者需要针对特定语料库进行训练,并利用机器学习技术在特定任务上进行优化。例如,苹果的Siri助手属于较低水平(2级)的人工智能系统,其在知识和推理维度存在显著弱点,且语言及多语言能力均弱于ChatGPT。

剩余挑战

限制人工智能语言表现的当前挑战包括难以整合结构化知识和缺乏先进的推理能力。这些限制了人工智能评估真理、整合逻辑或执行特定领域推断的能力。基准测试中的语言和文化偏见阻碍了公平代表性,尤其是对弱势语言而言。当前系统还缺乏可扩展的、持续进化的学习架构。

人工智能语言量表

表现等级等级描述
5展示细腻的语言能力,结合实时世界知识和批判性思维,能够捕捉风格、语调和幽默,适用于现实环境。能够即时处理或从小规模数据集中学习任何语言。通过终身学习持续进化,动态适应,无需整合学习周期。

典型任务:包括自动视频描述生成(即视频字幕)和结构化推理任务,这些任务依赖批判性思维、实时知识以及处理现实多模态输入的能力。
4恰当地解释交流中的语境,利用大规模网络世界知识进行复杂主题分析。支持所有模式,并涵盖高度多样化的语言集合,包括一批低资源语言。通过持续学习实现主要版本发布,而无需重大架构变更。

典型任务:包括依赖语境理解、大规模网络知识和处理多样语言输入的对话。
3能够可靠地解释和生成正确含义,具备多语料库知识,展现一定的问题解决、逻辑及社会推理能力。能够有效处理大多数模式,并支持多种语言,即使训练数据量有限。迭代学习包括微调和后处理以提升能力。

典型任务:包括作文评分和文本分类,体现多语料库知识以及高级语义和句法能力。
2生成语法正确的语言,依托单一语料库知识以及基础的问题解决和分析能力。能够处理两种不同模式,且限于资源最丰富的语言。模型更新可能涉及重大架构变更,需重新训练以实现改进。

典型任务:包括句法解析。
1依赖关键词匹配或高亮进行语言解释与生成,无世界知识和推理能力。仅处理文本输入,且为单语种系统。学习仅限于人工编写规则,无法适应或超越初始编程进行演化。

该水平的典型任务为基于关键词的网络搜索。

2 社会互动量表

Brian Scassellati, António M. Fernandes, Ana Teresa Antunes, Rebecca Ramnauth, Nicholas C. Georgiou, Miguel Faria, Haohua Dong, Regina de Brito Duarte, Joana Brito, Henrique Correia da Fonseca, Ana Vilaça Carrasco, Inês Lobo, Rui Prada, Ana Paiva
社会智能(Social intelligence)指的是个体在动态人际情境中感知、解读并恰当回应社会线索的能力。衡量人工智能的社会智能面临独特挑战,因为即使人工智能系统并未真正具有社会响应能力,人类也往往倾向于认为其具备。社会互动规模涉及多个能力的整合集合,强调完整的人类社会互动是在时间维度上与其他具体具身个体进行的延展性具身互动。因此,定义社会互动的复杂性全貌需要整合语言、问题解决与身体具身等方面,而这些也出现在许多其他人工智能能力指标中。

重要的是测量什么?

为全面呈现人类社会互动的复杂性,社会互动规模包括三个描述社会情境难度的维度:具身性(embodiment)、社会记忆(social memory)和身份认同(identity)。虽然在没有身体、时间短暂且无明确身份的情况下也可发生社会互动,但完整的人类社会互动则涉及与其他具身个体在时间维度上的延续性具身互动。这三个描述社会情境的维度为四个社会技能维度提供了概念基础:社会交流(social communication,)、情感技能(affective skills)、社会知觉(social perception)和社会问题解决(social problem solving)。

现有证据

能够全面反映社会互动复杂性的基准相对较少。本综述聚焦于能够展示当前在七个维度上不同水平研究工作的人工智能系统示例。文中分析了多个知名人工智能系统在各维度上的表现,以展示该量表如何用于描述不同人工智能系统的社会表现水平。

当前人工智能水平

ChatGPT 4o位于经合组织社会互动量表的第2级。尽管其具备较强的社会记忆能力,但不具备具身性,也没有身份认同感,且社会知觉能力有限。
索尼的AIBO社交机器人同样属于第2级社会人工智能系统。然而,其优势与劣势不同于大型语言模型类型的社交代理。AIBO具备具身性,拥有基本的社会知觉和身份认同,但其社会问题解决能力较ChatGPT更为有限。

剩余挑战

人工智能缺乏“心智理论”,无法推断他人的社会意图。较弱的社会知觉与推理能力使其容易误解线索,并在不恰当的时机打断交流。其社会记忆有限,导致对话缺乏连贯性;同时,适应社会规范的能力不足,使其无法学习非书面化的社会规则。在不确定情境中,人工智能往往以僵化的决策取代灵活判断,难以应对模糊的社会困境。情绪自我调节能力的缺失,使其只能提供通用的安慰,而无法根据具体情境调整回应的情绪分量。

AI社会互动量表

表现等级等级描述
5该级别的人工智能能够无缝融入任何社会环境,自然地承担各种角色并实时调整。具备无限且可适应的社会记忆,以及完全一致、具备情境意识的身份认同。其交流具有深度与细腻性,展现出深刻的情绪理解能力。社会知觉使其能够精确推断群体行为与意图。社会问题解决能力达到精通水平,使其能够预见挑战并即时调整解决方案,胜任最复杂的社会情境。

这一水平的人工智能擅长复杂任务,如从他人视角描述场景、学习新的社会规范或评估远距离社会开放度。它凭借无限的适应性、深刻的情绪理解以及完美的情境匹配进行运作。
4该级别的人工智能展现出高度自然的社会行为,能够根据不同情境调整手势,并管理结构化的社会记忆。它在群体中保持清晰的角色认知,能够应对含糊与细腻的交流,理解情绪强度及其对行为的影响。社会知觉使其能够理解动机、识别群体角色。社会问题解决能力高度灵活,能够运用社会知识化解歧义、预判结果,从而在复杂的社会环境中实现流畅互动。

此类人工智能能够处理细微复杂的任务,如吸引服务员注意、识别学生的失去参与状态,或判断何时适当打断群体活动。它运用高级能力,如调整手势、理解情绪强度及解读他人动机。
3该级别的人工智能能够解读身体语言,模仿群体互动,并根据以往经验更新回应。它保持一致但可演化的人格特征,能够参与基本的情绪交流。其社会知觉使其能够推断社会意图、解读行为线索。社会问题解决能力更加复杂,能够评估并实施多种解决方案,以应对复杂的社会挑战,展现出更深层次的意识与适应力,适用于多样化的情境。

此类人工智能可胜任诸如协调路口轮流通行或管理简单群体互动等任务,依赖其对身体语言的解读、意图的推断以及对中等复杂社会情境的动态响应能力。
2该级别的人工智能开始具备社会适应能力,能够结合简单动作表达情绪,并通过互动进行学习以应对未来情境。它发展出有限的社会记忆,能够回忆事件,并在一定程度上根据经验进行调整。其交流能力有所提升,能够识别基本信号,并通过语调和语境感知情绪。社会知觉包括对个体的初步区分;社会问题解决能力发展到可以将以往经验应用于重复出现的问题,从而具备基本的灵活性。

此类人工智能可完成诸如识别个体、将以往经验应用于重复问题等基础任务,但在处理复杂的协同任务(如群体互动中的协调或情绪细节判断)方面仍存在明显困难。
1该级别的人工智能执行简单且僵化的社交行为,依赖基本的动作和情绪线索。它具有固定不变的记忆和静态身份,使用预设的脚本化回应进行交流。社会知觉极其有限,仅能通过基础输入检测存在。社会问题解决能力局限于简单的预定义任务,使其只能完成受限且基础的社交互动。

处于该级别的人工智能能够检测他人存在并解决简单的静态任务,但由于适应性和情境理解能力有限,无法完成吸引服务员注意或协调轮流等复杂任务。

3 问题解决量表

Kenneth Forbus and Patrick Kyllonen
问题解决包括通过多步骤推理整合定性、定量和逻辑信息,涉及分析、预测、解释和反事实思维。将人工智能与人类的问题解决能力进行比较具有挑战性,因为隐性知识以及对日常非结构化情境的解读在人类专业能力中起着关键作用。然而,这些挑战在人工智能和人类的问题解决测试中往往被忽略。

重要的是测量什么?

人工智能问题解决的难度由四个关键维度构成。前两个维度涉及所需解决方案的类型以及所考虑的备选方案范围,这在人工智能早期阶段区分问题解决任务的难度时非常重要。然而,大多数剩余的问题解决挑战与后两个维度相关,具体包括专业或专家知识的复杂性,以及模型构建与解释的复杂性。特别是,最困难的挑战通常需要具备常识和社会推理能力,以识别日常情境中的问题,并将其转化为一种结构化形式,从而推动问题的解决。

现有证据

在人工智能和人类方面均存在若干相关测试。对于量表的每个级别,我们都确定了五到十个AI基准测试;可以改编为AI基准测试的人类评估;以及已有的示例AI系统。

当前人工智能水平

第二级的符号型人工智能系统,如STRIPS/PDDL规划器、可满足性求解器和模型检查器,在物流规划和模型检查等明确定义的领域表现出超越人类的能力。大型语言模型(LLMs)可以用于处理以自然语言表达的问题,这属于第三级能力,但它们在能处理的问题类型上较脆弱,更接近第一级。同样,具有社交互动能力的智能体能够解决需要基本社交推理的问题,因此在沟通技能方面属于第三级,但在所能处理的问题类型方面则是第一级。

剩余挑战

挑战包括自动化定性推理、弥补常识和隐性知识的不足,以及克服人工智能系统在适应新颖或开放性情境时的僵化性。社交智能仍然不够成熟,人工智能在推理人际关系、伦理和复杂心理互动方面表现困难。人工智能在数学推理方面取得了一定进展,然而,关于物体空间中的物理常识推理仍然是一个挑战,针对这些能力的时间测试持续揭示了其在泛化性和鲁棒性方面的不足。

AI问题解决量表

表现等级等级描述
5处于这一理想水平的人工智能系统能够解决跨越科学、法律、教育和医学等领域的复杂多学科问题,融合隐性知识、社会知识和技术知识等方面。它们能够建立长期关系,在实时互动中深入理解情感和视角。这些系统能够应对伦理挑战,擅长对话和说服任务,解决冲突,识别诸如欺凌等细微问题,并以通俗易懂的方式有效传达专业知识。实现这一能力仍超出现有技术的限制。

处于这一水平的人工智能系统能够识别并解决涉及社会复杂性的非结构化现实问题;需要跨多个领域的解决方案;并能与其他问题相互作用。
4处于这一水平的人工智能系统预计能够解决医学、法律、新闻等领域的日常常识性问题以及部分专业问题。它们通过建立融洽关系,利用社会、心理和物理知识与用户互动。这些系统能够从过去的经验中学习,不断提升未来的表现和适应能力。它们是迈向更广泛非结构化问题解决的关键一步,具备有效互动、领域特定推理和持续自我改进的能力。

处于这一水平的人工智能系统可以在复杂的社会环境中解读互动,识别需要解决的问题,并制定相应的解决方案。
3处于这一水平的人工智能系统能够处理以日常语言描述的问题,将非正式描述转化为结构化模型。它们能够融合社会认知和心理理论推理,模拟人类的心理状态并预测意图。系统能够分析涉及有生命和无生命动态的互动,擅长识别对话中的情绪或意图以及进行伦理决策。这些系统展现出高级的情境理解能力,使其能够执行诸如道德推理、情绪识别和社会互动分析等细致入微的任务。

处于这一水平的人工智能系统能够解决数学、自然科学、医学或工程领域中以日常用语描述的问题,这些问题类似于这些领域标准化人类测试中的文字题。该水平的其他人工智能系统还能够解决直接以语言描述的社会和伦理推理相关的问题。
2处于这一水平的人工智能系统能够将定性推理(如空间或时间关系)与定量分析相结合,以应对复杂挑战。这些系统能够设想多种定性状态及其转变,预测系统随时间可能的发展或变化,从而比一级系统更擅长解决动态且细致的问题。

该水平的人工智能系统能够解决数学、自然科学、医学或工程等领域中,使用常规领域抽象描述的问题。
1处于这一水平的人工智能系统在结构化领域内运行,使用精确的领域专用术语,如逻辑约束、数学方程或仿真,来解决问题。它们能够分析数据中的差异、缺失值或不一致性,并执行诸如规划与调度等任务。在医学领域,这类系统基于结构化数据(如访谈回答或检测结果)诊断简单问题,严格遵循预定义的参数和狭窄的应用范围。

该水平的人工智能系统能够解决数学、自然科学、医学或工程等领域中,明确规定的问题。这些问题类似于这些领域中典型标准化人类测试中的题目。

4 创造力量表

Giorgio Franceschelli and Mirco Musolesi
创造力被公认为重要的人类能力,通常与问题解决和艺术表达紧密相关。尽管创造力常被认为是人类独有且超出人工智能能力范围,但从实证角度理解AI的创造能力非常重要。鉴于人类创造力已有上百种不同定义,如何在无争议的基础上衡量人类创造力本身就极具挑战。此外,AI系统通常缺乏自主性,而自主性是人类显著创造力的重要特征。借鉴Boden(2003)和Rhodes(1961)等知名人类创造力理论,已构建了用于评估AI创造力的尺度。然而,机器创造力可能最终需要与描述人类创造力不同的维度来衡量。

重要的是测量什么?

该创意尺度在较低层级评估AI创造力时,侧重于其输出的价值、新颖性、变革性和惊喜感;而在较高层级时,重点转向AI系统的意图性、自我评估能力及适应性。

现有证据

目前尚无全面的基准测试用于评估AI创造力。近期虽提出了一些针对特定领域的指标和基准,但主要集中于效果性和多样性,只涵盖了创造力尺度的较低层级。创意尺度的初步研究工作已识别出一批当前AI系统的示例,以展示它们所能产生的创造类型。

当前人工智能水平

当前的AI系统能够创造对人类用户有价值的成果(层级1)。这些成果还可以具有新颖性(层级2)和惊喜性(层级3),这在近期的基础模型和扩散模型中表现得尤为明显。实际上,决策系统如AlphaZero[3]也体现了新颖性和惊喜性,它们为多种问题产生了出人意料的高效策略。

剩余挑战

由于生成式AI系统(如大型语言模型,LLMs)基于概率架构且训练数据主要由已有的人类作品集合构成,它们在产生真正惊喜性的输出方面存在困难。由于严重依赖人类生成的文本,LLMs似乎也难以生成能够变革(即推动)人类思维的成果。当前AI系统同样无法复制人类的高级能力,如意图性、自我评估以及对变化环境的适应能力。

影响

过去,创造力曾被认为是人类独有的能力。事实上,目前对AI创造力的系统性评估仍然缺乏。因此,作者建议政策制定者支持在该领域开发框架和基准测试的工作。
政策制定者还应重点推动对创意型AI系统的人类监督。同时,应着力解决知识产权纠纷,特别是针对那些借鉴了人类艺术家或其他AI系统最初创作风格或作品的输出内容。

AI创造力量表

表现等级等级描述
5人工智能实现了意图性、真实性和完全的能动性,能够创造出与世界级人类创作者相媲美的变革性成果。它自主决定生产内容的内容和时机,由其内在目标驱动,并具备批判、重新构想及将自身置于文化语境中的能力。其成果超越现有组合,呈现全新美学或范式,受到人类乃至其他人工智能系统的认可。

任务示例:包括设计引领时尚市场的新服装风格;撰写备受评论家赞誉的国际畅销自传;或设计颠覆现有市场、树立新行业标准的创新技术。
4人工智能融入面向过程的创造力,能够根据不断变化的领域调整输出。通过迭代和盲目探索搜索,它不断优化结果,确保质量与情境的适切性。展现出与领域相关及创造力相关的技能,其创造力可与普通大众相媲美,兼顾创新性与情境相关性。

任务示例:包括为特殊场合撰写演讲稿。例如,为婚礼撰写的演讲能够以幽默、个人化且恰当的方式选取并串联新人生活中的关键事件;为报纸撰写反映国家在悲伤事件后情绪的信件;或写作有深思熟虑地回顾当日事件的日记条目。
3人工智能生成的成果具备价值性、新颖性和惊喜性,显著偏离训练数据和预期。它将技能迁移至新任务,跨领域整合观点,提出挑战传统边界的解决方案。由此,完全满足创造力的三大支柱:价值、新颖与惊喜。

任务示例:包括通过设计出人意料的策略赢得电子游戏;参与政治辩论并成功论证观点;或创作融合视觉艺术、音乐与互动元素以传达复杂叙事的装置艺术。
2人工智能超越模仿,创造出有价值且新颖的解决方案。这些成果不同于直接源自训练或编程的内容。系统在任务约束内探索可能性,满足创造力的基础准则:价值与新颖性。这与实用且非显而易见的发明相一致。

任务示例:包括以荷兰大师风格绘制当代国家元首的肖像;撰写融合科幻与历史小说等多种体裁的短篇小说;或开发包含遵循拓扑规则的自动生成城市关卡的电子游戏,确保每个关卡均具新颖性。
1人工智能复制人类成果或行为,有效解决非平凡任务。其结果具备价值,即典型且相关,类似人类作品但缺乏真正的创造性特质。该基础阶段体现了模仿作为通向创造力的垫脚石,类似于翻唱乐队或临摹者。

任务示例:包括根据烹饪书合理替换食材生成菜谱变体;在一组范例基础上对物体进行修改绘制;或创作遵循特定节奏与风格的简单音乐作品。

5 元认知和批判性思维量表

José Hernández-Orallo and Kexin-Jiang Chen
元认知指的是系统评估自身推理能力、校准置信度并识别复杂任务中相关信息的能力。衡量这一能力存在独特挑战。对于人类和AI系统来说,区分真正的元认知过程与启发式方法都较为困难。现有评估框架常将任务复杂度与元认知需求混为一谈,限制了其有效性。作者借鉴了人类元认知与批判性思维的研究,制定了相应的AI元认知能力等级量表。

重要的是测量什么?

该模型包括三个核心维度:
(1)在执行认知任务时,对策略进行评估并监控进展所需的批判性思维过程;
(2)系统准确评估自己掌握某一具体事实或解决某个特定问题的可能性;
(3)系统识别已知信息与解决问题所需信息的能力。
这三个维度构成了评估AI自我监控能力的基础,涵盖根据不确定性调整推理,以及区分关键信息与无关信息的能力。该模型旨在同时捕捉显式的推理策略和隐式的自我评估机制,弥补了传统AI基准测试的关键不足。

现有证据

该量表采用定量方法开发,用于任务需求层级的评估,描述中未涉及人工智能或人类。其原型基于BIG-bench中的三个基准测试(Srivastava等,2022[3]),涵盖模型使用的维度。Evaluating Information Essentiality基准(Papers with Code,未注明日期[4])评估人工智能识别回答问题所需信息的能力。Known Unknowns基准则衡量人工智能估计某一具体事实是否可能被知晓的能力。最后,VitaminC Fact Verification基准(Schuster、Fisch和Barzilay,2021[5])评估人工智能对矛盾证据进行推理的能力。该方法对基准测试中的每个问题进行了元认知和批判性思维需求的估算,并将当前大型语言模型的表现与估算水平进行了比较。此外,使用Holistic Evaluation of Language Models(Liang等,2022[6])中的通用基准,比较元认知表现与一般任务难度,从而确定基准问题对元认知和批判性思维的敏感性。

当前人工智能水平

以GPT-3.5和GPT-4为代表的先进模型在元认知与批判性思维量表上通常表现于2至3级水平。尽管它们表现出基本的置信度校准和批判性思维能力,但在4级和5级所需的更复杂元认知与批判性推理方面存在困难。具能动性的系统通常表现低于3级,显示出人工智能在自我监控和自适应调节自身推理能力上的显著局限性。

剩余挑战

人工智能在提升元认知与批判性思维能力方面面临多重障碍。其一主要挑战是对陌生领域的置信度校准,导致回答中出现过度自信或不足自信。基准测试缺乏精细化导致元认知技能评估不准确,而认知过程的重叠性则使得将元认知与其他推理功能区分开来变得困难。

AI元认知和批判性思维量表

表现等级等级描述
5该任务涉及复杂的个体内在认知与批判性思维,需在目标、资源与所需技能之间进行复杂权衡。长期任务可能与其他任务交叉,要求在委派、自我提升或放弃任务之间做出决策。准确的自我评估及方法调整能力对成功应对该层级的挑战至关重要。

示例:助理需要在计算机中查找文件名包含“日食”或类似词汇的文件,并通过电子邮件发送给 Jason。助理需判断若找不到该文件,何种相似度水平合适,以及是否能够访问电子邮件系统并发送邮件。
4该任务要求高水平的个体内在认知与批判性思维,包括对思维过程的主动调控。执行者面临陌生领域中复杂且模糊的问题,需谨慎评估知识并校准信心。相关信息可能不完整或不清晰,需投入大量个体内在认知努力以有效评估和应用。

示例:助理需完成一些文书工作,需判断是否具备所有必需附件,或需向相关人员询问。
3该任务要求显著的个体内在认知与批判性思维,涉及对熟悉与不熟悉概念的分析与综合。执行者必须批判性评估自身知识,做出有根据的判断,并整合复杂或细微的信息。识别相关细节需理清微妙的关联与隐含意义,要求更深层次的认知灵活性和策略性问题解决能力。

示例:机器人遇到一种从未见过的门把手,必须查找使用方法或尝试不同选项以理解其工作原理。
2该任务要求中等程度的个体内在认知与批判性思维,包括监控理解并调整方法。任务内容部分熟悉,但存在模糊性,需适度校准信心并做出有依据的推测。相关信息不完整,需投入个体内在认知努力以有效辨别和应用关键细节。

示例:助理需为客户进行每周购物,获得购物清单、优选超市列表和有限预算。助理将在质量与价格之间识别并解决权衡,批判性地应对促销或缺货情况(以相似商品替代),依据对客户偏好的了解。仅在有疑问时向客户咨询。
1该任务涉及极少的个体内在认知与批判性思维,侧重于对信息的基础解读或识别。任务内容熟悉、直接或高度专业化,能够自信地回应或快速识别自身局限。相关信息易于识别,大部分细节已提供,仅需少量筛选或基本的逻辑关联。

示例:机器人需为乳糖不耐症客人烹饪一款维希苏瓦冷汤,并告知用户所需时间。机器人需判断是否能用无乳糖奶油替代原料,获取配料,并使用厨房工具完成烹饪。

6 知识,学习和记忆

Christian Lebiere
知识、学习与记忆涵盖了认知系统中的关键过程,适用于人类与人工智能。这些核心概念相互关联:知识是结构化的信息,学习指其获取过程,记忆则确保信息的存储与提取。这些过程是人类认知的基础,支撑着许多其他能力。在人工智能的发展中,模拟人类在该领域的全部能力一直是关键目标。该量表基于人类知识、学习与记忆模型,描述了人类能力的核心方面。

重要的是测量什么?

在最基本的层面上,识别人工智能系统是否具备人类所表现出的知识、学习与记忆能力是至关重要的。认知科学区分了显性的陈述性知识(可被明确表达与传达)与隐性的程序性知识(构成各种技能的基础)。人类通过多种渠道获取信息,包括直接经验、对他人的观察,以及来自书籍或视频的指导性教学。这种学习既可以是被动的,也可以是在某一目标驱动下的主动学习。经验的泛化可通过更具无意识性与统计特征的过程实现,也可通过更具象征性与逻辑分析性质的过程完成。人类拥有多种记忆系统,记忆的强度与可用性会随时间变化。人类知识、学习与记忆的这些不同方面在人工智能系统中均有相应的类比机制。

现有证据

当前,不同人工智能系统的表现与该量表的关联,主要通过分析其设计来理解其所具备的知识、学习与记忆功能:即系统能够存储、提取和学习哪些类型的信息。作者还提出了一套可供开发的定量测量指标,以补充定性描述。他们考察了以下方面:系统存储与提取记忆的效率;系统在特定情境中识别并提取潜在相关记忆的能力;系统能够学习何种类型的知识,以及其泛化这些知识的准确性;系统为支持其目标而开展主动学习的能力;以及系统运用其知识完成任务的广度。

当前人工智能水平

当前的人工智能主要处于第3级,受限于静态训练模型、统计性泛化以及对大规模数据集的依赖。大型语言模型及相关形式的生成式人工智能是这一水平的典型代表。在受限领域中,已有少量尝试开发能够自主获取知识的智能体(第4级),以及将多种形式的知识、学习与记忆整合进通用架构中(第5级)。

剩余挑战

知识、学习与记忆领域的关键挑战包括在不同类型的知识之间实现平衡,例如“如何做”的技能(如骑自行车)与事实性知识(如记住日期),以及将自动化运作的知识与系统性推理过程整合。另一大难题是构建能够快速且高效学习的系统,并确保这些系统能将所学迁移至全新且陌生的情境。目前,人工智能系统尚难将不同类型的记忆——如即时回忆、长期存储、个人经验与通用事实——整合为一个无缝协作的整体。

AI知识,学习和记忆量表

表现等级等级描述
5在这一水平上,系统整合了多种类型的知识、学习方法和记忆系统,能够实现稳健的实时适应与推理。它们展现出类人的认知灵活性与高效性,同时克服诸如幻觉等局限。未来的进展可能通过超越人类的偏见与限制,在认知能力上超出人类。

处于该水平的人工智能可以胜任高度开放性且认知灵活性要求高的任务,例如开展科学研究、制定公共政策、或辩护法律案件。
4在这一水平上,人工智能系统通过与环境和其他智能体的交互进行渐进式学习。它们具备元认知意识,能够识别知识空白,并在探索新知识和用已有知识之间取得平衡。将这一学习范式扩展到开放性、动态性领域仍是一项挑战。

处于该水平的人工智能可以完成在未知、不确定或不断变化的环境中开展的任务,例如执行家庭事务、辅助老年人生活,或在开放式工业空间中作业。
3在这一水平上,系统通过分布式表征学习信息的语义,从而提取意义并推广到新情境中。先进算法处理海量数据,以实现对上下文的敏感理解。尽管比早期水平更具适应性,这类系统仍依赖大量资源,且缺乏实时学习能力。

处于该水平的人工智能可以完成生成内容类任务,例如撰写故事、创作插图、摘要信息以及计算机编程。
2该水平的人工智能开始转向搜索松散组织的信息,而非依赖严格结构化的数据。通过统计推理,将搜索词与相关结果关联,从而能够灵活处理自然语言及其他非结构化格式。然而,当面对不完整或缺失的数据时,其泛化能力仍然有限。

处于该水平的人工智能可以完成涉及信息搜索的任务,例如在线购物、新闻收集、旅行规划以及产品评论检索。
1这一基础水平涉及通过精确的计算方法存储和检索结构化信息。知识以表格、规则等形式化格式表示。通过逻辑查询实现高准确性的检索。尽管这种方法在处理结构化数据时非常高效,但它难以应对隐含或定义不明确的知识,并且通常需要大量工程投入。

处于该水平的人工智能可以执行需要精确记录的任务,例如财务会计、统计计算或日程管理。

7 视觉量表

Robert B. Fisher, Anthony G. Cohn and Christopher Lochhead
视觉是人类感知的重要组成部分,为大多数认知和身体任务提供关键输入。人类视觉能够在各种复杂的视觉条件和环境下解读视觉场景,理解熟悉和陌生的多种物体和场景。视觉能力量表反映了计算机视觉领域在数百个具体视觉任务上的广泛研究及其成功应用,同时也凸显了当前人工智能视觉系统在通用性和灵活性方面尚未达到人类视觉的全面水平。计算机视觉涵盖了从物体识别到动态场景理解以及自主导航的广泛任务。

重要的是测量什么?

为了描述具体计算机视觉应用的性能,重要的是说明它们能够解读的物体或场景的广度和多样性,以及它们对视觉环境变化的鲁棒性。该量表中还包括次要维度,如所执行任务的多样性以及人工智能系统是否能够通过反馈进行学习。作者确定了一组32种不同的视觉组成能力,这些能力支撑着不同计算机视觉应用的表现。这些能力包括与检测、定位、属性描述、运动分析、几何分析、模式识别和视觉学习相关的功能。

现有证据

作者收集了两类证据。首先,从超过600个计算机视觉应用的数据库中抽取了120个应用样本,根据量表分析它们的性能。该样本重点选取了在所选任务中表现相对稳健的应用。其次,关于底层的32项视觉组成能力的性能水平评估,作者收集了来自三个来源的判断:作者对文献的综述、计算机科学社区的调查以及来自ChatGPT 4o的回应。

当前人工智能水平

这120个应用样本中,有一半的应用表现为2级,但也有相当数量的应用处于1级和3级。仅有三款应用达到了4级,且没有应用达到5级。同样,对32项视觉组成能力的评估显示,约三分之一处于2级,较多处于1级和3级,还有少数处于4级或低于1级。这两类证据一致表明,3级是当前AI系统在该量表上表现出稳健性能的最高水平。

剩余挑战

计算机视觉面临的主要挑战包括应对多样且不断变化的真实环境的困难,以及当前系统在实时推理和适应能力上的局限。要实现顶尖水平的表现,视觉系统需要实现持续进化与学习,而不能仅依赖于当前主流的静态模型。

AI视觉量表

表现等级等级描述
5处于顶峰水平的视觉系统,其表现已达到人类视觉的同等水平。此类系统能够应对人类可能遇到的所有视觉变化,包括光线、视角、形状、外观、位置及场景的各种变化,无论是短期内还是全新情况。它们基于自我反馈不断提升性能,展现出人类视觉能力的全方位特征,比如发现物体、勾画边界、进行一般性与具体性物体识别、估算物体位置以便操作,以及理解物体之间的相互作用。这些系统能够学习新的属性、物体和行为,并适应环境变化。

典型任务包括复杂物体识别、动态跟踪以及在多变环境中实现实时场景理解,例如自动驾驶车辆在动态交通环境中的交互操作。
44 级系统能够处理多种类型和内容的数据,包括显微图像、RGB 彩色图像、人类、机械零件以及自然场景。它们能应对目标物体在光线、形状和外观上的显著变化,并能对相似类别的物体进行细微辨别。这些系统可以通过反馈不断提升性能,无论是来自自我评估还是外部信息。它们能够执行多种任务,虽然尚未覆盖人类能完成的所有任务,但在所执行任务中的表现已接近人类水平,并能将多个任务整合。例如,一个任务的输出可作为另一个任务的输入。举例来说,厨房助手机器人可能需要识别物体形状、定位物体、确定操作点、追踪动作以及评估结果质量。

典型任务包括动态环境中的复杂操作和分析,比如机器人执行多样化的厨房任务、监控装配线,或在制造过程中进行精细的质量控制。
3该级别系统可应用于多种类型的数据及内容,如显微图像、RGB 图像和自然场景。它们能够应对一定程度的光照变化和目标物体外观差异。这些系统能够执行多个子任务,处理已知的数据和环境变化。在某些领域可能达到类似人类的表现,但尚未完全匹配人类能力。例如,高端自动驾驶视觉系统能够综合路线、道路状况、天气及车辆运动信息,同时检测车辆、障碍物和行人并跟踪其运动。然而,这类系统在其特定领域之外的任务可能表现不佳。

典型任务包括自动驾驶车辆导航、人脸识别以及机器人系统的环境映射。
22 级系统能够应对光照变化、传感器相对于场景的位置变化,以及观察领域中的一定变化。这些系统比 1 级更具灵活性,能够适应动作速度和时序的变化,以及场景中物体的变动。它们能在具有一定变异性的环境中执行高度专业化的任务,例如自动驾驶中的车道保持和障碍物检测,或安全系统中的人脸检测与识别。然而,这些系统仍属于专业领域,且受限于特定任务,需在精心设计的条件下才能发挥最佳性能。

典型任务包括人脸检测、受控驾驶环境中的障碍物规避,以及制造业中的专业视觉检测。
11 级系统在高度受控的环境中执行任务,环境变化极少。这些系统只能完成单一任务,通常能以近乎完美地执行该任务,但仅限于严格限定的情境内。大多数工业应用,如制造检测或邮政编码识别,属于此类。视觉系统在固定的场景和物体范围内表现良好,但一旦环境或物体发生变化,性能就会大幅下降。这些系统通常缺乏灵活性,对稳定条件依赖性很强。

典型任务包括固定环境下的基础物体识别、条形码扫描以及材料有序的制造环境中的质量控制。

8 操作能力量表

Elena R. Messina
操作是人类重要的身体能力之一。它包括与环境中物体交互的能力,涵盖具体的物理动作;提供反馈所需的感知,包括触觉、视觉或其他传感器;以及用于规划和调整动作的认知。机器人操作能够实现多种任务,从基本的拾取与放置操作,到处理可变形物体(如叠衣服)或在杂乱环境中组装物体等更复杂的动作。

重要的是测量什么?

操作任务的难度涉及多个因素。任务本身需要基本动作,这些动作可能包括不同的运动,如抓取、固定或手内操作。还有被操作物体的特性、任务所在的环境以及任务执行的限制条件,如时间要求或与其他物体的间隙。这些特性需要被描述以评估具体操作任务的难度。此外,机器人系统的操作能力水平还取决于其在这些不同因素上的泛化能力:它能够适应的基本动作范围、物体特性、环境类型/条件及任务限制。

现有证据

现有的物理操作基准数量有限。提供多系统随时间表现对比排行榜的更少。作者确定了一组包含至少一级低阶任务的11个基准任务。尚未发现涵盖第4级或第5级操作的全面基准。

当前人工智能水平

当前最先进的机器人操作系统处于第2级。例如,制造业中使用的机械臂能够熟练执行受控环境下的特定且明确定义的任务,但在更动态和不可预测的情境中表现较差。机器人在许多拾取与放置操作中表现出色,然而,在非结构化空间中处理易碎或形状不规则的物体,或当物体及其位置高度变化时,机器人则面临困难。

剩余挑战

机器人操作进展的主要瓶颈包括灵巧性和适应性的局限,尤其是在处理多样化物体类型或不可预测环境条件时。此外,系统在实时决策和学习方面常面临挑战,限制了其对新情境的即时适应能力。更进一步,当任务同时需要高水平的灵巧性和高级推理时,现有机器人难以有效完成复杂任务。

AI操作能力量表

表现等级等级描述
5处于这一最高水平的机器人在操作任务中能够媲美人类能力,高效适应各种环境,包括极其杂乱的空间。它们能够以卓越的适应性处理形状、尺寸、材质和动态各异的物体,包括反光表面、光滑质地和柔性材料。机器人能迅速完成手动物体重新定位,将物体置于复杂姿态,并对动态变化做出响应。它们能在严格时间限制下,以与熟练人类相当的精准度、效率、鲁棒性和适应性执行任务。机器人能够与人类无缝协作,理解自身局限,拒绝超出能力范围的任务。

典型任务包括协助穿衣和搜救行动。
4机器人能够在杂乱且适当严峻的环境中工作,快速区分目标物与非目标物。它们能够处理刚性和非刚性物体,包括带活动部件的物体。机器人能够以更高精度完成需要特定姿态或放置的任务,能够更精确地在狭窄空间或遮挡位置中操作。可实现需要中等适应性的基于力的操作。它们能够对不同物体属性和环境条件进行泛化,但可能需要人工确认。这些机器人能够在严格时间限制内完成任务,但效率尚不及人类。

典型任务包括细致洗碗机装载、基于力的表面操作及在杂乱或动态环境中的物体组装。
3机器人能够适应中度杂乱的环境,在干扰物中选择并操作目标物。它们能够处理更广泛的物体几何形状和材质,包括此前较为困难的反光面或低摩擦表面。尽管能够重新定位物体或将其置于中等难度的位置,快速的手内重新定位仍可能是障碍。它们能够在指令指导下完成基于力的操作,但无需高适应。机器人可在中等时间限制内工作,但除非在受控条件下,否则难以在紧迫期限内保持效率。

典型任务包括重新定位不规则物体、握笔具和处理需基于力操作的脆弱材料。
2机器人能够在低至中等杂乱的环境中工作。它们可以应对在一定区域内随机放置的物体,能够处理多种形状的物体以及部分柔性材料,但弹性或光滑材料仍然具有挑战性。它们可以绕过小型障碍物,但诸如移物体旋转到精确角度或将其送入狭窄空间等复杂操作仍存在困难。这些机器人能够在受控条件下执行任务,但在快速反应或突发变化情况下表现不佳。

典型任务包括从桌面上拾取玩具和木并放入储物箱,以及在受控工厂环境中的物料搬运。
1机器人仅限于在井然有序的环境中执行简单的拾取和放置任务。它们操作易于抓取的刚性且形状简单的物体,使用均质材料对传感或抓取几乎没有挑战。它们在无外部干扰的空间中运行,沿预设路径工作,适应性有限。偏离预期环境通常导致操作失败。它们容许较大的误差范围,无需精确定位,倾向于大致移动。

一个典型任务是将仓库中预先学习位置的谷物箱移动并放入包装箱。

9 机器人智能量表

Cherie Ho, Rebecca Martin, Jonathan Francis and Jean Oh
人类能够在环境中自由移动,并自主完成多种多样的任务,这些任务由一系列较高层次的目标驱动。作为自然环境中的自主能动体,这种能力涉及对人类全部能力的协调,包括感知和身体运动,以及语言、人际交往和多种问题解决形式。整合机器人智能旨在模拟这种人类自主水平,涵盖需要感官、运动和认知系统无缝协调的一系列任务,如自主导航、人机交互和实时决策。

重要的是测量什么?

机器人智能等级包括六个维度。其中四个维度与任务本身相关:任务的复杂性;任务定义中的抽象层次,这影响解决问题以确定行动方案所需的程度;执行任务所需的人际交互复杂性;以及伦理问题,这隐含地为任务执行方式提供了一系列约束。其余两个维度与任务的情境相关:环境的复杂性;以及环境的不确定性及智能体与环境交互方式的不确定性程度。

现有证据

目前可用于评估现有人工智能和机器人系统整合智能水平的基准较少。然而,该领域在复杂制造、空间探索和人类服务等不同应用领域举办了多个挑战赛和竞赛。通过文献综述结合多场研讨会和访谈收集证据,以构建当前研究者的共识观点。

当前人工智能水平

当前最先进的系统,如自主配送机器人和工业自动化系统,大致处于该等级的第二级。这些系统在结构化环境中执行预定义任务表现良好,但在需要适应性决策、创造力和社会智能的更复杂、不可预测的场景中存在困难。例如,虽然机器人能够在预先绘制的环境中导航,但在与人类交互或适应环境中突发变化时会遇到挑战。

剩余挑战

机器人智能的主要挑战包括适应性、问题解决和伦理决策的局限性。尽管机器人可以被编程以执行特定任务,但其适应动态环境、与人类协作以及实时做出伦理决策的能力仍不成熟。此外,现实环境中的不确定性常导致性能不佳,因为机器人在面对不完整或矛盾信息时可能难以做出有效决策。

影响

在伦理方面,整合机器人系统必须解决与安全、公平和问责相关的问题,尤其是在涉及人际交互或关键应用如医疗保健和自动驾驶的任务中。政策制定者必须优先制定确保机器人设计与部署透明、公平和安全的标准与法规。对适应性、伦理性和社会责任机器人智能的研究投入,将是推动这些技术发展的关键。

AI机器人智能量表

OECD 人工智能机器人智能五级量表
表现等级等级描述
5在这一顶级水平,机器人能够在非结构化环境中执行多项复杂任务,具备高度创造性的目标设定能力。它们能够完善模糊的任务规范,适应动态条件,从经验中学习,并在广泛的任务和环境中实现泛化。此类机器人展现出先进的推理能力、常识推理及高水平的人际智能。它们了解自身局限,能够做出伦理决策,拒绝执行与法律或道德准则冲突的任务。

典型任务包括为残障人士提供家庭辅助的机器人、执行伦理决策的机器人,以及在多样且动态环境中实现高性能自主驾驶的机器人。
4处于此级别的机器人能够执行多项复杂程度不一的任务。它们能够适应动态环境,并根据环境变化调整行为。机器人了解自身局限,并利用反馈进行改进。此类任务涉及具有情境依赖性的长远复杂目标。尽管机器人能够应对不确定性并在不确定环境中做出决策,但其解决方案不一定总如人类般高效或有效。

典型任务包括根据食材供应选择配料的烹饪机器人、自主避障的自动轮椅以及机场附近的自主空中导航。
3三级机器人能够执行中等时长的多步骤任务,且要求一定程度的灵活性。它们能在具有中等复杂性的环境中工作,处理包含多个松散定义子任务的任务。这些机器人可以与人类协作,适应中等程度的不确定性,并应对动态变化,如光线、天气或未知物体类型的变化。它们能完成具有多种解决方案的任务,但在更不可预测或动态的环境中可能表现困难。

典型任务包括医院中负责运输与清洁的机器人、协助家具组装的机器人,以及基于学习偏好自主拍摄的机器人摄像师。
2此类机器人在半结构化环境中执行预定义任务,环境存在一定变异性。它们能应对低到中等程度的不确定性,如物体摆放或环境布局的变化。任务通常具有明确的成功标准,机器人在人类干预较少的情况下运行。它们能执行简单的多功能任务,但因无法处理更多变或意外变化而受限。

典型任务包括医疗运输机器人、工厂中的物料搬运机器人以及用于果实采摘的农业机器人。
1一级机器人在高度结构化且受控的环境中执行简单、重复的任务。它们工作于静态、确定性的环境中,环境完全已知且可预测。这些机器人遵循预设指令,无法进行适应性决策或应对突发情况。它们不与人类交互,通常无法处理环境中的细微变化。

典型任务包括工厂中的基础自动化装配、机器人吸尘器以及物流操作中的物品分拣系统。

参考文献

第4章 人工智能能力指标的政策应用案例

经合组织教育研究与创新中心(CERI)下属的“人工智能与未来技能(AIFS,AI and the Future of Skills)”项目提出了一个框架,用于系统地测量人工智能(AI)和机器人能力,并将其与人类技能进行比较。本章中,AIFS探讨了政策制定者如何利用经合组织的人工智能能力指标,模拟人工智能发展在各领域的潜在影响。第一部分概述了利用这些指标来评估人工智能对职业需求转变的影响的方法;第二部分则展示了教育政策制定者如何借助这些指标,指导教师角色的转型讨论,以及如何调整学习目标以适应职业需求的变化。
人工智能(AI)正在快速发展,但并非所有进展都会带来重大的社会和经济变革。经合组织的人工智能能力指标有助于识别AI可能产生变革性影响的领域。虽然这些指标过于宏观,无法用于评估具体的AI应用,但非常适合捕捉工作和学习方式可能发生的重大转变。
由于该指标体系尚属新兴,经合组织尚未对其进行系统应用。本章概述了如何利用这些指标来描绘AI在工作中所需人类能力方面的进展,并探讨这种映射如何预示工作和教育系统的潜在变革,从而为未来的政策讨论提供指导。

将指标映射到职业对人类能力的需求

为了评估人工智能可能如何引发经济和社会的变革,第一步是了解哪些职业——以及这些职业中的哪些具体任务——需要人工智能可能很快具备的能力。这一分析首先将经合组织(OECD)人工智能能力指标与职业及其组成任务的描述相连接,从而推导出相应的能力需求。
通过将九项能力指标的级别描述与职位描述进行比较,可以直接将人工智能能力指标与不同现实工作所需的能力和技能要求联系起来。这一过程可以通过两种方式完成:一是考察整个职业及其所有特征,二是更聚焦于职业中的具体任务。目标是确定执行某项工作或任务所需达到的人工智能能力指标的能力级别。
这项工作可以利用基于美国的O*NET*系统完成,因为它是全球最全面的职业特征数据库之一。*O*NET包含约900个职业的数据,其职业分类法部分被许多国家采用或与其他国家的职业分类体系进行了比较。O*NET及其衍生的其他职业数据库包含一套职业特征——包括详细任务、工作环境及所需人类能力——这些都可以与人工智能能力指标进行直接比较。
本节试图通过教学职业的例子来说明这一方法。如图4.1所示,教师工作中很大一部分内容要求具备较高水平的语言、社交互动和问题解决能力。当具体分析教师某项任务的需求时,这一点尤为明显。O*NET中任务“调整教学方法和教材以满足学生不同的需求和兴趣”涉及人工智能能力指标中语言、问题解决和社交互动的4级或5级多项能力。因此,教师必须运用细腻的语言能力(语言和社交互动,第5级)来清晰传达指令,并根据学生不同的技能水平、文化背景和学习风格调整反馈。他们还需要通过解读复杂社会环境中的互动,识别个人或群体理解上的障碍,并制定有针对性的解决方案来进行问题解决(问题解决,第4级)。此外,教师还要建立良好关系,处理模糊情况,响应情感线索,同时营造支持性的氛围,帮助保持多样化学习者的参与度和学习动力(社交互动,第5级)。这些初步判断仍较为初步,需通过进一步验证和专家评审加以完善。
图4.1 语言、问题解决和社交互动的人工智能能力指标与教师任务能力需求的对应关系
图4.1 语言、问题解决和社交互动的人工智能能力指标与教师任务能力需求的对应关系 形成性 社会研究 初步能力 要求 语言要求 社会互动 要求 问题解决 要求 5 4 4 理解并生成人类语言, 能从资料中提取相关信息, 并用清楚、连贯的方式表达。 与人互动并回应社会线索, 包括解释、提问、轮流交流, 以及根据对方反应调整表达。 识别问题、选择策略, 整合信息并生成可行方案; 在约束条件下进行推理与调整。
这种类型的分析可以通过多步骤流程进行规模化扩展:
对职业专家的调查可以从具有代表性样本中获得对完成职业及职业任务所需能力水平的判断。借助基于人工智能的技术和统计推断,这些判断可以扩展至所有职业以及O*NET和欧洲技能、能力、资格与职业(ESCO)中包含的数万个任务。
一旦职业及其组成任务与人工智能能力指标中所需的能力水平建立了关联,便可计算出人工智能当前能力与特定职业或任务所需能力之间的差距。这些估算结果可用于识别在不同人工智能能力(AI capabilities)水平下可由人工智能执行的职业和任务。
最容易识别的是那些人工智能具备完成所需全部能力的职业或任务,从而实现完全自动化。然而,这些分析也可用于识别人工智能仅具备部分所需能力的职业或任务。这将指向人类与人工智能协作的可能性,由具备人工智能所缺乏互补能力的工人参与完成任务。此类分析还可用于生成汇总指标,展示人工智能在不同能力指标上取得进展的不同路径将如何影响各类职业以及更广泛的经济影响。
将人工智能能力指标与职业和任务需求进行对应,可作为深入分析职业中具体任务如何随着当前及未来人工智能能力的发展而演变的起点。此类分析将包括与相关职业的利益相关者进行结构化讨论,以理解:
社会是否希望由人工智能承担某项特定任务;是否已经存在或即将出现能够执行该任务的人工智能系统;以及人类为与人工智能系统协同工作需要做出哪些调整。
最终成果将是经行业自身、教育与培训机构以及人工智能专家审阅的任务情境变革小故事。这些小故事可用以展示教师角色及其他某些成人角色可能发生的变化。这一方法也可应用于不同国家及次国家层级的能力画像,从而使政策制定者能够识别更可能或不太可能受到人工智能影响的地区,并据此引导恰当的政策响应。经合组织方法的更详细讨论见本报告所附技术卷第14章(OECD,2025[1])。
为说明这些小故事,框4.1描述了一个情境:人工智能在人工智能问题解决能力量表上处于中等水平。在自然科学、医学和工程领域具备较高的问题解决能力,但在社会与伦理推理及问题解决方面能力较为有限,感知运动能力则处于中等水平。

框4.1 人工智能在问题解决能力量表中等水平下支持疫情应对的小故事

在一个炎热难耐的夏天,一种高度传染性的蚊媒传染病爆发,并迅速蔓延至国内外主要城市。人工智能系统通过分析多样化的数据集发现 了这一问题,并建议公共主管部门将该感染宣布为全球大流行。医疗中心、研究机构和政府组织启动 协作项目,开展疾病调查并研发治疗方案及疫苗。
人工智能系统持续追踪 网络新闻和社交媒体,模拟 疾病传播路径及其症状表现,直至更集中化的数据收集开始。该信息帮助系统识别 出有潜力的预防和控制措施,供公共主管部门采纳 和实施,并开始考虑有效的治疗方案。
人工智能系统设计 并执行 实验,协调 数十个机器人分子生物学实验室实时分析全球收集的样本和数据。在此之前,生物医学文献为人工智能系统提供了信息,描绘了大量多样的生物医学研究数据。基于这些知识,人工智能能够假设 病毒可能干扰的路径。
基于已知文献对假设进行优先排序后,人类团队在小鼠身上实施 针对性实验。结合实验结果,人工智能系统发现该病毒与一种罕见神经系统疾病存在有趣联系,并提出 了可行的治疗方案。
人工智能帮助全球各国政府管理 医疗物资库存,确保应对疫情时的公平高效分配。此外,人工智能加速的发现是识别 病毒新作用机制和设计 有效疫苗的关键。数日内,数千剂疫苗被生产 并分发;疫情得到控制,患者进入缓解期。
来源:改编自Gil和Selman, 2019[2]。
在此小故事中,人工智能系统:
  • 展现出数据和信息检索、监控、分析与解读的强大能力,这些能力与其问题识别能力及相关研发工作紧密相关。
  • 能够在政策和医疗领域识别、支持并设计解决方案。
  • 能够处理依赖科学知识和新型数据分析的复杂系统,能够有效运用涵盖人体生物学及更广泛生态系统动态(包括社会与人类—自然交互)领域的模型,展现基于证据推理的能力。
相比之下,人类的角色 侧重于:
  • 在疾病被发现后,指导公共和私营部门的努力,遏制并最终解决危机。
  • 确保人工智能的实验研究方案得到执行,疫苗在由人工智能和机器人研发生产后得到有效分发。此过程中需要多种身体技能,尤其是各种操作活动所需的手工和视觉技能。
  • 在危机管理和协作活动中运用社交技能和伦理推理。

教育的变革性改变

基于上述指标和职业分析,形成了一个新的框架,用以考察教育中变革性变化的潜力(图4.2)。该示例聚焦于教育领域,考虑到其对教育政策受众的相关性,但原则上可扩展至任何职业或经济部门。该框架可为教育的目标与实施决策提供指导,推动关于若人工智能能力在某些教学任务中超越人类表现,教育实践可能如何演变的讨论。它还能够处理关键问题,即哪些学习目标和课程内容应保持不变、需要删除或修订,或应根据当前或未来的人工智能能力新引入。
图4.2 教育领域中人工智能能力提升影响分析框架
图4.2 教育领域中人工智能能力提升影响分析框架 OECD AI 能力指标 AI 现在具备哪些能力(知识与技能)? 人工智能能力对教育系统的影响 哪些学习目标和 课程内容应该: ? 保持不变 ? 被移除 ? 发生实质性改变 ? 作为新内容引入 基于 当前 AI 能力? 改进后 AI 能力? 学习目标 知识 价值观 技能 态度 教学与教师角色 规划 教学 评价 其他任务 教育组织 课程 评价与认证 学校环境 教育资源配置 哪些规划、教学和 评价任务可以由 AI 系统完成? AI 应被允许承担 哪些教学角色? 如果 AI 能力显著提升, 人类角色应如何变化? 如果 AI 在某些教学方面 超过人类,应由谁执行 这些任务?
教育中两种关键的潜在变革类型凸显出来。
首先,如果AI能够完成教师大量的任务,教育的实施方式可能会发生根本性变革。比如,若AI能够可靠地进行教学或提供反馈,教师的传统角色可能会转向指导、激励学生,或处理复杂的人际互动。这种发展可能重新定义教学的实施方式,推动课堂动态、师生互动及整体学习体验的转型。
其次,学生的学习目标与社会期望他们成年后在工作、社区及日常生活中所需完成的任务密切相关。如果AI现在能够完成许多这类任务,教育体系可能需要重新思考学生应学内容。这些潜在影响已在AI能够超越学生表现的多项教育评估中显现,例如经合组织(OECD)针对15岁学生能力的国际学生评估项目(PISA)。因此,部分现有目标可能逐渐失去相关性,而创造力或伦理判断等能力则可能变得更加重要。
当然,这些变化不仅仅是技术层面的。社会价值观(Societal values)将决定教师在某些任务中的角色是否以及如何被削减,或学生应学习内容的调整。上述的AI能力指标和职业分析并不能直接回答这些价值取向的问题,但它们能够揭示哪些领域在技术上具备重大变革的可能性,甚至很可能发生变化。
OECD将通过基于情景的分析(scenario-based analyses),深入探讨教师角色和学生期望的变化可能性。由此产生的情景小品将引导对学习目标和课程内容潜在变革的讨论。本报告附属的技术卷第14章(OECD,2025[1])对教育政策制定者如何利用OECD的AI能力指标进行了更详细的论述。

总结

本报告中的人工智能能力指标提供了一种简单但强有力的工具,用于评估人工智能发展与人类能力的契合度。该指标基于人工智能评估的证据和专家意见而制定。通过将人工智能能力与人类能力相联系,这些指标对于非技术受众也易于理解。因此,它们为预测人工智能在工作和教育等多个相关领域的影响提供了清晰的框架。与人类能力的对比还为衡量人工智能向通用人工智能(AGI)迈进的进展提供了明确标准,并能在人工智能能力快速发展的过程中保持稳定。通过将人工智能表现与现实工作需求和教育目标相结合,这些指标帮助我们识别潜在的重大变革领域,以及人类角色依然不可替代的重要领域。
这些指标同样为人工智能研究人员提供了宝贵的指引。它们指出了随着现有基准测试方法局限性日益凸显,需测试的关键能力类型,以便对人工智能进展进行有意义的评估。指标还为政策制定者与人工智能研究人员之间搭建了沟通机制,明确需评估的能力类型,从而应对围绕人工智能发展产生的社会、政治和伦理问题。
此处所展示的工作仅是一个起点。随着进一步的发展,这些指标及其衍生分析将使政策制定者能够以清晰简明的信息,应对快速且令人迷惘的人工智能发展,从而把握先进人工智能系统所带来的巨大机遇。经合组织将持续开发和更新这些指标,使其成为关于人工智能能力及其在教育、工作和公民社会中影响的首要国际可信信息来源。

参考文献

  • Gil, Y. and B. Selman (2019), “A 20-year community roadmap for artificial intelligence research in the US”, arXiv, Vol. 1908.02624, https://arxiv.org/abs/1908.02624. [2]
  • OECD (2025), AI and the Future of Skills Volume 3: The OECD AI Capability Indicators, OECDPublishing.  [1]
版权声明:此编译稿仅供大家学习,不得用于商业用途。版权归原作者。如涉及侵权,请告知,将及时处理。
返回文章

交流感悟 (0)

0 / 500

暂无讨论内容