Nature:给AI智能体绘制治理画像
单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达

导语
能够回答问题的聊天机器人、调用工具完成工作的数字助手、在道路上自主行驶的汽车,都被称为AI智能体,但它们造成风险的方式并不相同。将这些系统笼统归入同一类别,容易导致治理错位。有些系统需要内容过滤,有些系统则必须限制工具权限、记录行动轨迹并设置自动熔断。2026年8月发表于Nature的这篇论文提出智能体画像框架,以自主性、行动效力、目标复杂度和通用性四个维度描述AI智能体。该框架不试图用单一风险分数排列所有系统,而是分析不同能力组合对应的控制、审计、责任和跨领域治理要求,为AI智能体从技术分类走向差异化监管提供了一套概念坐标。
关键词:AI智能体,智能体画像,自主性,行动效力,目标复杂度,通用性,可扩展监督,AI治理


论文题目:Agentic profiles for effective AI governance
论文链接:https://doi.org/10.1038/s41586-026-10805-z
发表时间:2026 年 8 月 12 日
论文来源:Nature
长期以来,AI研究者始终对AI智能体抱有浓厚兴趣,其范畴涵盖从强化学习智能体到自动驾驶车辆¹-⁴。然而,近期的研究催生了一类新型AI智能体,它们以强大的基础模型为核心,并辅以进一步的脚手架(scaffolding),从而具备高级推理能力、记忆与工具使用功能⁵。基于这一架构,在不久的将来,我们很可能将目睹大量新型AI智能体被部署于诸多现实领域⁶-⁸。此类智能体可能呈现多种形态⁹,包括高级AI助手(如Google DeepMind的Astra)、数字伴侣(如Replika)、AI研究员或导师(如Snorkl)以及新型自主机器人。
为更好地理解这一趋势并使之具有可操作性,我们回顾了当前具有影响力的多种AI智能体定义,批判性地考察其构成要素,并构建一个追踪AI智能体关键维度的框架,尤其关注这些维度对技术性与非技术性AI治理的意蕴。我们将AI智能体刻画为这样一类系统:它们能够在有限的外部控制下,跨多个领域执行日益复杂且具影响力的目标导向行动。本质上,我们关注的是一大类人工系统,它们能够独立地追求广泛的目标与任务,从而对世界施加因果影响。
AI智能体的广泛部署可能对现有的社会、经济与政治实践产生深远影响¹⁰。例如,AI智能体可能通过自主执行以往需要人类劳动者完成的认知任务,如分析法律文件或编写软件代码,来扰乱劳动力市场。它们还可能从根本上重塑人类与AI的互动方式,成为人类无处不在的对话者、执行者与建议来源,而人类可能与之形成准社会关系(parasocial relationships)¹¹。
鉴于此,我们需要理解并分类不同类型的AI智能体,探究其意蕴,评估其治理需求,并将努力导向负责任的部署。具体而言,我们需要防范此类系统的部署与使用可能引发的即时个体风险与系统性挑战¹²-¹⁴。在个体层面,这包括预防事故与恶意使用¹⁵˒ ¹⁶。在集体层面,这意味着理解并驾驭多个人类与AI智能体相互互动时涌现的复杂动态,包括协调失灵以及智能体之间的有害竞争或合谋¹⁷。从实践角度而言,治理结构还需解决以下问题:如何为AI智能体的行为分配法律责任与职责¹⁸;如何针对AI智能体运行的不同领域实施监控与审计程序¹⁹;如何为此类智能体创建可允许的行动空间与认证协议²⁰;以及如何构建智能体间交互与通信的基础设施²¹。
所幸的是,在治理AI智能体方面,我们可以借鉴若干现有框架,尽管它们所提供的指引尚不完备。例如,自动驾驶车辆监管通常采用一种图式来衡量该领域AI系统所展现的自主水平,并提供与车辆所展现的自主水平相适配的指引²²。其他路径,如《欧盟AI法案》²³与美国国家标准与技术研究院(NIST)的《AI风险管理框架》²⁴,旨在对AI系统所附带的整体风险水平进行分类,并采用与该风险相称的保障措施。然而,这两种路径均可从进一步关注AI智能体的新属性中获益,尤其是那些改变系统风险轮廓的关键维度。通过描绘并理解AI能动性的不同维度,我们旨在表明新的横跨性治理议题由此浮现。
本文构建了一个概念框架,沿四个维度描绘AI智能体的特征,为每一维度制定一套可分级的类别,并讨论这些维度的治理意蕴。我们首先探讨计算机科学中流行的AI智能体刻画方式,识别统合这些论述的核心构成属性。随后,我们对每一属性给出更为详尽的界定、对该解读的正当性论证,以及一套等级划分,用以说明属性禀赋处于较高或较低水平时的样貌。我们运用该框架来阐明四个现有智能型AI系统的属性,为AlphaGo、ChatGPT-3.5、具备工具使用功能的Claude 3.5以及Waymo构建智能体画像。最后,我们讨论由这种对不同类型AI智能体的理解所引出的治理意蕴,并确定未来研究的关键方向。
AI智能体的定义
AI智能体的定义
理解与刻画智能体有着悠久的历史。智能体的哲学基础²⁵-³³与法律基础¹⁸˒ ³⁴已得到广泛探讨,不同理论旨在解释智能体在系统、有机体与组织中的存在或缺失。研究者致力于分析不同类型的能动性,包括生物能动性³⁵-³⁷、认知能动性³⁸-⁴⁰、群体能动性⁴¹-⁴³以及共享能动性⁴⁴-⁴⁶(后者涵盖多个行动者共同达成的决策)。这些概念以各种方式影响了计算机科学中对智能体的理解⁴⁷˒ ⁴⁸,而计算机科学中的理解反过来又在现代AI系统的发展中发挥了基础性作用。
近年来,AI智能体的概念呈现出多种形态。强化学习研究聚焦于开发自主AI智能体,它们通过与环境的交互和反馈来学习最优行为³。此类智能体已取得显著成功,尤其是在游戏环境中⁴⁹-⁵¹。与此同时,基于智能体的建模与仿真方法强调,在构建能力更强的人工系统的语境下,社会互动与涌现性具有重要意义⁴。近期研究还探索了能够进行有限形式元学习(即学会学习)与自我修改的智能体⁵²˒ ⁵³。最后,在语言模型的推理领域,通过思维链推理⁵⁴以及迭代式自我纠正和对成功生成的推理路径进行微调⁵⁵,已取得进展。推理协议的融入是诸多模型近期取得突破的核心,如Claude 3.5(参考文献⁵⁶)、Gemini 2.5(参考文献⁵⁷)与OpenAI的o1模型⁵⁸。
然而,值得追问的是,是什么将这些不同类型的AI智能体统合起来?这些不同的概念在哪些维度上、跨越哪些特征趋于汇合或产生分歧?表1展示了AI与机器学习文献中七种核心论述的比较。
表1 | 计算机科学中七种具有影响力的AI智能体定义

在以下各节中,我们识别这些定义的共性、差异、优势与不足,阐释我们所认定的AI智能体四项核心构成属性:自主性、效能、目标复杂性与通用性,并运用这些属性为不同类型的AI智能体精心打造智能体画像:AlphaGo、ChatGPT-3.5(独立聊天补全)、Claude 3.5 Sonnet(具备工具使用功能)以及Waymo自动驾驶车辆。
自主性
自主性
自主性是所有AI智能体定义的核心属性。在各种定义中,研究者反复强调AI系统的自主行动(D.3, D.5)。其他论述则聚焦于自主智能体(D.2, D.6, D.7)或自主行为,例如在无直接监督的情况下形成观点(D.4)。从哲学立场来看,自主性可以多种方式理解,包括消极自由,即免于某些外部约束的自由,与积极自由,即无需协助即可追求目标的能力⁵⁹。自主性有时也与智能体所能采取的行动范围或自由度相关联⁶⁰。在AI智能体的语境下,自主性最好被理解为无需外部指令或控制即可执行行动的能力。这一刻画捕捉了AI智能体的独特之处:它们能够独立地确定并执行(指向特定目标的)行动序列,而无需逐步的引导。在大多数情况下,相关的外部指令或控制来自由单个人或一群人构成的委托人(principal),尽管在某些情况下也可能来自另一个AI系统或控制机制。
尽管各种AI智能体定义普遍关注自主性,但整个领域缺乏一种标准化的方式来分类或衡量AI智能体所具备的自主程度。所幸的是,自主性概念已通过一种分类量表在自动驾驶车辆中得到建模²²˒ ⁶¹。我们认为,该量表可经有益调整后用于刻画一般AI智能体的自主性。AI自主性的相关等级划分如表2所示。
表2 | AI智能体的自主性等级

效能
效能
智能体的第二项关键特征是其与环境互动并对环境施加因果影响的能力。效能这一属性见于每一种定义,它们将智能体描述为能够通过效应器作用于环境(D.1)、感知环境并作用于环境(D.2)、修改环境(D.3)、在虚拟世界中采取一系列行动(D.4)、在较长时间段内采取行动(D.5)、在多次迭代中采取行动以执行目标(D.6)以及感知环境并执行行动(D.7)。在这些语境中,效能指的是智能体感知并因果性地影响其环境的能力:一个无法与环境互动并施加影响的实体不是智能体。
然而,与自主性一样,若要衡量不同AI系统在因果影响,进而是能动性上的差异,就需要一套更为精细的区分。一个只能推荐交易的AI财务顾问与一个能够自主执行价值数百万美元市场交易的AI财务顾问之间存在巨大差异。一个提出诊断建议供医师审阅的医疗AI与一个通过联网医疗设备直接实施治疗的医疗AI之间同样如此。
智能体的效能既取决于该智能体在该环境中的能力(即它对结果所能施加的控制水平),也取决于它能够运行的环境类型(即从人类生命与福祉的视角来看,该环境具有多大的重要性)。
依次来看,智能体在环境中的能力在因果影响力大小上各不相同。(衡量智能体所展现控制水平的一种方式是"赋能度"(empowerment)⁶²,即智能体通过其行动影响未来感官输入的能力。)环境内影响的相关等级划分如表3所示。
表3 | 因果影响等级

我们可以依据状态持久性、在给定空间中所发生行动的潜在可逆性,以及该空间中的行动对其他行动者的后果,来区分不同类型的环境⁶³。作为起点,区分完全模拟的、中介的与物理性质的环境是有助益的(表4)。
表4 | 环境类型

将这两个要素结合起来,便可以构建一个环境影响矩阵,用以说明不同类型AI智能体在效能上的预期差异(表5)。该矩阵在期望意义上将智能体在环境中的因果影响程度与该环境的整体重要性相结合。
表5 | 指示AI智能体效能水平的效能矩阵
模拟 | 中介 | 物理 | |
仅观察 | E.0 | E.0 | E.0 |
受限 | E.1 | E.2 | E.3 |
中等 | E.2 | E.3 | E.4 |
全面 | E.3 | E.4 | E.5 |
该效能矩阵中的数值代表潜在影响水平的递增,进而代表部署AI智能体时相关风险的递增。在所有环境中,仅观察系统所对应的0值反映了这些系统无法施加直接因果影响。随着系统在给定环境中获得更强的因果能力,且环境本身变得更为重要,因果影响随之增加。例如,物理环境中一个受限的AI智能体(E.3),其整体效能水平可能与一个对中介环境具有中等控制的智能体(亦为E.3)相当,这凸显了环境语境如何能够放大即便有限的能力。此处所使用的因果效能概念,可以借助因果模型框架等形式化框架得到更为精确的阐释⁶⁴-⁶⁶。然而,这一实质性任务并非本文的目标,故留待他日。
目标复杂性
目标复杂性
目标复杂性与目标导向行为构成了不同定义中的第三项共性要素,作者们指出智能体能够:从事"对自身议程的追求"(D.2)、"实现其设计目标"(D.3)、"规划第二天"(D.4)、"在较长时间段内实现目标"(D.5)、"在多次迭代中执行目标"(D.6)以及"规划并执行行动"(D.7)。
尽管存在这一概念上的共同基础,但围绕这些目标的语义地位与结构构成,以及不同的目标类型学如何可能引致智能体能力在性质上不同的表现,仍存在更深层的理论分歧⁶⁷。一些定义强调有能力的智能体在较长时间跨度上进行规划的能力(D.5),而另一些则聚焦于实现任何类型的设计者指定目标(D.3),无论实现该目标所需的时间长短。我们主张,目标复杂性是此处起作用的关键特征。简而言之,能力更强的AI智能体能够形成或追求更为复杂的目标。
目标的复杂性在直觉层面易于表述:关掉一个电灯开关比找到合适的人生伴侣或为国民经济选择正确的利率要容易得多。这种复杂性也可以通过迷宫的隐喻来理解:复杂性随着到达终点所需的每一步、每个岔路口的选择数量、是否存在需要并行执行的行动以及迷宫的规模而增加。(例如,AlphaGo面临的最令人生畏的挑战之一,就是该游戏所涉及的庞大动作空间,其可能的变化数超过了宇宙中的原子数量⁴⁹。)一个简单的目标可能有一条明显、直接的路径,而一个复杂的目标则要求智能体穿越许多棘手的决策点。然而,目标是复杂的这一概念还需要在其他方面加以拓展。
理解目标复杂性的一种方式是通过层级规划⁶⁸˒ ⁶⁹。该方法通过将复杂目标分层组织来加以管理。目标分解将复杂目标拆解为结构化的层级:顶层为抽象目标,中间层为日益具体的子目标,底层为可执行的行动。层级规划方法使AI系统能够通过在适当的抽象层级上处理目标,来应对不同复杂度的目标。
AI系统目标的复杂性也可以通过将所需任务的规划长度作为代理指标来近似估计。这涉及通过专门聚焦于成功执行目标所需的步骤序列与数量来衡量复杂性。例如,可以通过将AI系统所执行任务的长度与人类通常设计或要求完成可比任务的长度进行比较,来评估AI系统目标的复杂性⁷⁰。通过评估AI系统能够可靠执行的任务的规划长度(以典型人类努力为基线),我们可以获得其在现实世界中实现复杂目标之能力的具体度量。
目标复杂性的另一个方面是多目标性:如果一个目标要求智能体同时优化多个准则(例如,自主无人机必须在最小化能耗和规避危险的同时最大化搜索覆盖范围),那么复杂性水平更高,因为智能体必须权衡取舍。在AI研究中,多目标优化问题被明确用于测试此类复杂性⁷¹。目标复杂性还涉及智能体必须满足的约束与条件。例如,需要在特定约束下实现的目标("在不让Y发生的情况下实现X")比可以不受约束地实现的目标更为复杂。(目标复杂性可以从信息论视角使用柯尔莫哥洛夫复杂性⁷²、香农熵⁷³、计算复杂性理论⁷⁴或系统论立场⁷⁵等度量来操作化。)
基于这些基础,我们提出的目标复杂性等级划分如表6所示。
表6 | AI智能体的目标复杂性等级

通用性
通用性
通用性指的是AI智能体在不同角色、语境、认知任务或具有经济价值的任务之间有效运行的能力。其范围从专注于特定任务的高度专业化AI智能体,到能够在不同领域之间切换的通用型智能体。尽管通用性并非我们所考察的每一种定义的显式特征,但AI系统所展现的通用程度长期以来一直是研究者的兴趣点,尤其是在围绕人工通用智能等高级AI系统的讨论中⁷⁶˒ ⁷⁷。在此,通用性刻画的是超越狭义专业化、迈向能够在多样环境与任务领域中发挥作用的更广泛能力的演进。
在通用性的较低水平上,我们发现"能够完成特定任务的智能实体"(D.7),但除此之外仍受到约束。相比之下,更为通用的智能体能够在不同领域中确立并追求目标,而不仅仅是在狭义参数内执行任务。正如Park等人⁵³所指出的,如今单个智能体已能在虚拟环境中从事一系列活动,包括"醒来、做早餐、去上班;……作画"(D.4)。诸如Claude 3.5(具备工具使用功能)等AI智能体还能在现实世界中承担日益广泛的任务,包括编程、驾驭在线互动、检索信息以及为用户提供建议。
从理论视角来看,Hutter⁷⁸提出了对通用智能体最具雄心的刻画之一。他的AIXI理论将所罗门诺夫归纳与序列决策理论相结合,以智能体在整个可计算选项空间上的表现来定义通用性。然而,尽管该理论为通用智能提供了严格的数学理想,但它是不可计算的,主要充当理论基准,而非实际实现的基础。
在更实际的层面上,Morris等人⁷⁹的一篇有影响力的论文将通用性刻画为"AI系统能力的广度,即AI系统达到目标性能阈值的任务范围"。这些作者区分了"狭义"系统与"通用"系统:前者只能执行范围明确的任务或任务集,后者则能够处理广泛的任务,包括涉及学习新技能等元认知能力的任务。在该论述中,通用性与模型性能。以"熟练成年人"的能力为基线,都是人工通用智能系统的关键属性。尽管如此,虽然这一分类法为衡量通用性提供了有价值的起点,但它仅代表解决这一复杂问题的一种路径。至关重要的是,就我们的目的而言,通用性以程度而非二元属性的方式呈现。我们需要更多地了解一个AI智能体究竟有多狭义或多通用,才能对其潜在影响做出合理的预测。
基于这项工作,我们提出的通用性等级划分如表7所示。
表7 | AI智能体的通用性等级

智能体画像
智能体画像
综合来看,前述维度可用于为不同类型的AI智能体构建"智能体画像"。我们在专栏1与专栏图1中通过描绘不同类型AI系统的智能体画像来阐释这一方法:(1)AlphaGo;(2)ChatGPT-3.5(独立聊天补全);(3)Claude 3.5 Sonnet(具备工具使用功能);(4)Waymo自动驾驶车辆。
在我们的论述中,一个候选智能体如果无法采取免于外部控制的行动、无法影响其环境、无法追求目标,或没有任何应用领域,那么它实际上就不是智能体。然而,超越这些最低界限之后,广泛的智能体形态皆有可能,且各维度可以多种方式相关联或复合叠加。值得注意的是,尽管目标复杂性与通用性等属性常常同时出现,但它们在分析上是不同的:高目标复杂性可以存在于狭义的任务领域中(例如,考虑一个管理全球空中交通的AI系统),而通用智能体(如初级的家庭助手)可能在多个领域中运行,却仍只能执行简单任务。
此外,必须指出,智能体画像并非静态的。持续的模型开发。包括内部结构的变更、新功能的增加以及模型部署方式的改变,能够极大地影响所考察的智能体类型,即便它们以同一基础模型为脚手架。例如,考虑增加工具使用功能,如访问应用程序编程接口(API)或外部知识库。工具使用可大幅提升效能,而访问外部知识则可增加目标复杂性(当它允许智能体更新其世界模型,而非局限于训练时所生成信息的集合时)。
在模型架构中增加推理与记忆功能时,可能发生类似的相变:高级推理可大幅提升自主性与目标复杂性,使智能体能够在无需人类引导的情况下完成更多工作并绕过某些障碍,而记忆则通过使智能体能够建模并执行涉及时间持久性的行动序列来增加目标复杂性。反过来看,许多大语言模型仅具有情景记忆这一事实,严重限制了它们追求长期目标的能力。
最后,考虑现实世界部署的影响,或将AI智能体集成到拥有数亿用户的服务中的后果。这些发展导致效能的显著飙升,并 necessitate 一种不同类型的治理框架——包括为能够在世界中采取行动的智能体制定新协议²¹。这反过来又引出了更深层的治理问题:不同AI智能体的连续性或分立性,以及智能体画像应当如何更新或修订的流程。
专栏1 | 智能体画像
AlphaGo是一款专为在模拟环境中对弈围棋而设计的专业化AI智能体⁴⁹。该系统通过学习职业围棋对局以及自我对弈来掌握复杂的博弈策略与局面评估。AlphaGo展现出中等自主性(A.3),因为它能够在无需人类监督的情况下评估并执行博弈策略。然而,启动与结束对局、处理技术问题以及确保遵守赛事规程仍需人类监督。AlphaGo的环境影响水平较低(E.1),因为它仅在受控的模拟围棋对弈环境中运行。它在此空间内进一步受到游戏规则的约束,且只能影响对局结果。AlphaGo的目标复杂性较低(GC.2),因为它主要追求单一统一目标(最大化获胜概率),但这涉及复杂的行动序列。然而,它无法生成围棋对弈之外的目标。最后,AlphaGo的通用性较低(G.1),因为它仅在围棋这一单一领域中运行。

ChatGPT-3.5(独立聊天补全)是一款基于聊天的语言模型,可进行对话、处理语言任务并生成代码。ChatGPT-3.5具有部分自主性(A.2),这得益于其在对话中独立生成回复与解决问题的能力。然而,它需要人类输入来启动任务并验证输出,还需要持续监督以确保事实准确性与内容生成的适当性。ChatGPT-3.5在中等效能水平(E.2)上运行,工作于中介环境中,能够通过其回复影响人类的思考与决策。然而,该系统无法在无人类干预的情况下在线采取行动或直接影响物理世界。ChatGPT-3.5具有中等目标复杂性(GC.3),因为它能够对一系列复杂请求做出合理回应。然而,当目标足够复杂时,它缺乏可用于将复杂请求拆解为子任务的主动"思考"或"推理"。ChatGPT-3.5的通用性水平相对较高(G.3),因为它可以完成跨越不同领域的多组任务(例如信息检索、建议、翻译等)。
Claude 3.5 Sonnet(具备工具使用功能)是一款基于聊天的语言模型,能够利用不同工具(如浏览器控制)与推理协议执行一系列更为高级的任务。它具有中等自主性(A.3),因为它能够在无需直接人类监督的情况下执行扩展的行动序列。该模型还在较高效能水平(E.3)上运行,主要通过中介环境发挥作用,但具备通过应用程序编程接口(API)调用等计算机操作更为直接地塑造世界的能力。由于集成了更强的推理能力,Sonnet 3.5还展现出比ChatGPT-3.5更高的目标复杂性(GC.4)。它能够跨多个目标协调活动,并执行更长的行动序列。最后,Sonnet 3.5继续展现出高通用性(G.3),利用语言理解、计算机操作与分析能力在多个领域中有效工作。
Waymo是一款自动驾驶汽车,配备传感器、摄像头与计算系统,用于在无需人类操作的情况下在道路上导航。该系统整合雷达与视觉数据来感知环境并实时做出驾驶决策。Waymo具有非常高的自主性水平(A.4),因为它能够在无需人类控制的情况下在复杂的现实世界环境中导航,并就路线规划、障碍物与安全做出实时决策。尽管它保持远程监控与人类监督能力,但它能够处理意外情况(尽管在极端情况下可能请求人类协助)。Waymo还具有高度效能(E.4),因为它与物质世界进行直接的物理互动,在交通流中造成持久的状态变化。其行动的可逆性有限或不可逆,并对其他智能体(包括乘客与其他车辆)产生真实后果。Waymo具有高目标复杂性(GC.4),追求将乘客安全运送至目的地的主要目标,同时管理包括路线规划、避障与遵守交通规则在内的子目标。该系统在适应实时环境变化的同时,积极平衡安全、速度与乘客舒适度等相互竞争的优先级。最后,Waymo具有中等通用性水平(G.2),因为它能够处理驾驶与导航领域所需的一揽子任务。
治理AI智能体
治理AI智能体
智能体画像为治理AI智能体这一复杂事业提供了一个统合性脚手架¹⁹˒ ²¹,它具备三项关键功能:结构化分类,明确与治理相关的AI能动性方面;风险映射,利用评分识别开发与部署中具体的、画像特有的风险;风险缓解,设定相称的要求,并实现针对特定画像的精准干预,从技术透明度与可审计性措施²⁰˒ ⁸⁰到非约束性最佳实践⁸¹˒⁸²与法律规则²³。构成智能体画像的各维度,无论是单独考察还是综合考量,均对AI治理具有意蕴。
首先,AI智能体所展现的自主性水平,是决定开发者、监督委员会与监管机构应如何应对安全与控制相关风险时的关键考量。像Waymo这样的高自主性(A.4)智能体与像ChatGPT-3.5这样的低自主性(A.2)对话智能体之间的差异,阐明了核心治理问题。前者在无需人类输入的情况下就路线、障碍物与安全做出实时的、瞬间的决策,而后者在未被提示的情况下无法发起行动。这种差异进而产生了不同的安全要求。独立规划与行动的高自主性智能体需要强有力的保障措施,恰恰因为它们压缩或消除了监督者的决策节点。更高的自主性还造成了复合错误的可能性:初始错误可能通过后续决策传播,待到人类发现问题时,实质性损害可能已难以遏制。例如,一个高自主性(A.4)的AI电网控制器可能将微小的电压波动误判为严重故障;在数毫秒内,它可能发起一系列重新路由的"纠正",在人类监督者甚至还未处理初始警报之前,这些纠正就级联演变为区域性停电。因此,此类智能体需要一套强有力的治理机制,例如:用于审计的追踪日志分析⁸³;可扩展监督⁸⁴,利用自动化系统(可能是其他AI)来大规模管理与监督任务;以及在检测到错误时可立即中止运行的紧急停止开关⁸⁵。
智能体效能通过将焦点转向智能体切实的、现实世界的后果,以及该影响是中介性的还是直接性的,来影响我们对AI风险的理解。对于效能评分较低的智能体,例如局限于完全模拟环境中的智能体(如虚拟游戏中的AI智能体),风险映射可能只需考虑数据损坏(AI智能体损害其自身模拟环境的风险)或数字安全(AI智能体越狱退出沙箱以访问主机或网络的风险)等挑战。然而,对于物理环境中的高效能智能体(如Waymo),整体风险负担可能大得多,涵盖广泛的、具有重大影响的现实世界后果。事实上,导致实质性损害或公共安全风险的主要途径完全存在于模拟环境之外。效能还可能极大地影响部署AI智能体时所需的法律问责水平。对于具有物理影响的高效能系统(如机器人智能体),开发者与监管机构需要建立更强的问责链与可审计性。
目标复杂性带来了进一步的治理挑战,因为智能体的行动可能变得更难理解,或以意想不到的方式偏离其指定目的。尽管目标简单的智能体通常可以通过一致性测试来评估,例如将摘要器的输出与人类基准进行比较,但随着AI目标变得更为复杂,验证其行为的挑战也大幅增加。这是因为目标复杂性使智能体的透明度降低,并为"规范博弈"(specification gaming)等非预期行为创造了机会——在规范博弈中,智能体发现巧妙的方式来追求或颠覆其所被赋予的目标。为应对非透明行为的可能性,需要更为精密的技术工具与人类监督——例如,机制可解释性技术⁸⁶,它使AI的内部推理过程更易于调查。因此,AI系统中更高的目标复杂性要求增强透明度与问责制。这可以通过追踪个体行动的方法(如分配唯一标识符²⁰)以及阐明智能体交互的方法(如建立标准化通信协议⁸⁰)来实现。
最后,AI智能体的通用性以多种方式影响治理干预的范围与性质(专栏2、专栏图2与专栏表1)。通用性评分较低的高度专业化智能体可能在狭义领域内构成风险,但不太可能产生跨越多个部门的系统性效应。因此,特定领域的保障措施通常足以管理这些风险。相比之下,能够在各个人类领域中执行多样任务的通用型AI智能体,可能跨越系统边界传播风险,或因在未预料到的语境中应用而展现出意外行为¹⁴˒ ⁸⁷。因此,通用性有助于确定治理措施应当是特定领域的,还是应当跨越相互关联的部门。它还影响在需要跨领域治理措施时应如何设计这些措施。除此之外,鉴于通用性与劳动力替代效应之间已被提出的关联⁸⁸˒ ⁸⁹,通用性对于理解AI的经济后果也具有相关性。随着AI智能体变得更为通用,其部署可能潜在地取代更大部分的人类劳动力,从而引出超越传统监管边界的经济组织、财富分配与社会稳定问题。
综合理解,从治理视角来看,某些属性组合可能也特别值得追踪。例如,尽管效能是风险的核心,但自主性、目标复杂性与通用性以某些方式加剧了这一挑战,塑造了可用于遏制风险的选项集。或者,自主性与目标复杂性可能开始驱动替代效应,即便这仅在特定部门中成立。总的来说,我们认为,此处引入的细微差别防范了那种粗糙的、线性的观念,即一个"更具智能性"的系统总是需要"更多治理"。真正重要的是智能体的类型与所涉及的治理类型。例如,一个低自主性但高效能的系统,如用于医疗分诊的AI系统,构成了局限于医疗决策领域的尖锐但狭义的风险⁹⁰。与此同时,正如Park等人⁵³所预期的那样,在模拟环境中运行的通用高自主性智能体,不需要以同样的方式进行日志记录、审计并使其服从授权协议。在第三种情形中,兼具高自主性、效能与通用性的AI智能体构成了复杂的、跨部门的问题,需要在多个领域中进行集中化的指导与引导。
专栏2 | 不同AI智能体的治理意蕴
为便于说明,让我们比较两种AI智能体:一个简单聊天机器人,与一个高级AI助手¹⁰。后者能够代表用户浏览在线界面、进行购物并做出其他执行性决策。假设简单聊天机器人的画像为[A.1, E.1, GC.2, G.2],高级助手的画像为[A.3, E.3, GC.4, G.4],如图所示。由于高级助手在每一个智能体维度(自主性、效能、目标复杂性与通用性)上的排名均高于简单聊天机器人,这些画像为确立与比较不同的治理标准提供了有用的基线。专栏表1列出了针对这两种画像的非穷尽性治理标准清单,凸显了它们所援引的对比性机制。

专栏表1 | 两种智能体画像的治理机制

展望
展望
本文提出的框架旨在为将AI智能体映射至治理提供基础。尽管在确定不同智能体画像的度量与基准方面仍存在重大挑战,但培养对AI能动性更为深刻的理解,对于负责任地引导其开发与部署、确保其变革性潜力得以实现,同时以远见与精准应对相关风险,至关重要。需要进一步的工作来持续地衡量与评估本文所提出的AI能动性各维度。事实上,为AI智能体开发可测量指标的过程,要求持续的跨学科协作,以确保指标具有充分的理论依据、准确且适用于各种AI架构与任务。例如,效能或许可以使用赋能度⁶²˒ ⁹¹等指标来衡量,而目标复杂性则可以利用层级规划文献中已确立的方法⁶⁸˒ ⁶⁹来形式化,以分析AI目标的结构与深度。然而,为能动性的每一维度选择并验证指标,仍是一项值得关注的艰巨任务。此外,未来工作的一个核心问题是:谁应当设计智能体画像、决定特定的等级划分并建立治理机制。尽管本文提供了说明性示例,但正式标准与最佳实践的基础仍有待发展。
此外,确定当这些系统在不同语境中行使能动性时谁应负责,需要描绘一条清晰的问责链。该链条必须连接到相关的法律主体,包括开发者、部署者、集成者与平台所有者。进一步的工作应当研究智能体画像如何与法律责任、受信义务与监督义务相关联。例如,如果一辆自动驾驶车辆闯红灯并造成事故,应当如何分配责任?最后,全面的治理需要一个丰富的损害风险模型,其中包括环境损害⁹²、多智能体损害风险¹⁷与系统性损害⁸⁷。这些都是复杂的问题,需要在其他地方加以探讨。回答它们所提出的问题,是建立有效AI智能体治理制度的关键一步。
参考文献
参考文献可上下滑动查看

文章精选:
1.图灵奖得主姚期智最新演讲: AI有边界,恰恰是好事
