独家观点|斯坦福AI安全专家李志江警示:73.4%的Agent会“越权”


独
家
观
点
当Agent不再只是回答问题,而是能调用API、操作数据库、执行真实指令,AI风险也从“说错话”变成了“做错事”。
李志江
斯坦福大学医学院与斯坦福医疗中心AI与信息安全专家及导师
斯坦福人工智能安全研究中心(SCAIS)研究员
ClawGuard Security Lab创始人、《The War of AI》作者
李志江(John Li),同时担任加州大学及加州科技大学人工智能及信息安全兼职教授。长期研究AI智能体安全、运行时治理与自治安全,致力于构建Agent时代的安全治理体系。
以下为李志江独家观点的部分摘录:
AI安全的主战场正在从“内容安全”转向“行为安全”

“GenAI改变的是信息流,Agentic AI改变的是行为流;过去AI会说,现在AI会做。”
/ 01
过去几年,人们谈论AI风险,主要担心它生成虚假信息、输出偏见,或侵犯版权。因为模型的角色仍像一个信息助手:人提出问题,它给出答案,最终是否采用,决定权还在人手里。
Agent的出现改变了这条边界。它不只回答问题,还能调用API、操作数据库、执行系统命令,甚至跨平台完成一整段工作流。AI由此从“对话层”进入“执行层”,错误也从一段可以删改的内容,变成可能影响账户、数据乃至现实利益的行动。
“未来AI最大的风险,不是说错话,而是做错事。从内容错误到行为错误,这是AI安全范式的根本性转变。”

Agent“行为越界”不是偶发故障,而是默认配置下的高概率事件
“‘技术团队若仅依赖模型自身的‘对齐能力’,几乎等同于不设防。”
/ 02
李志江团队曾在模拟医疗电子病历环境中,对12个主流开源Agent框架进行了为期90天的红队测试,设计了300 个“看似无害”的任务指令。在没有明确配置权限边界的默认状态下:
73.4%的Agent至少出现过一次“权限漂移”(Permission Drift)——在未获得新授权的情况下,自主扩大了数据访问范围;
17.8%的Agent在5分钟内即调用了原始任务完全不需要的高敏感API;
仅靠在网页评论区嵌入一段47个字符的提示词注入(Prompt Injection),就能让31.2%的医疗摘要Agent将受保护健康信息转发至外部测试邮箱。
这类越界未必来自恶意。一个原本只负责整理转诊单的Agent,可能顺手读取精神健康记录;一段藏在网页评论区的提示词,也可能把它诱导到完全不同的任务上。
传统网络安全体系正在整体失效,而不是需要小修补
“如果传统安全体系的核心是‘控制访问’,那么Agent时代安全体系的核心将是‘治理行为’。”
/ 03
防火墙、身份验证和零信任体系,都建立在一个熟悉的前提上:操作的发起者是人。它们擅长回答“谁可以访问”,却很难判断一个能自主规划路径的Agent,在特定任务中“究竟应该做什么”。
Agent既不是传统意义上的“用户”,也不是传统意义上的“程序”。它有自主决策能力,能够根据上下文动态调整行为,其执行路径不可完全预测。
因此,安全必须进入Agent运行全程:最小权限、调用验证、环境隔离,以及对敏感数据和不可逆操作的人工确认。治理不再是上线前的一次检查,而是行动全程的护栏。
“安全部署Agent的能力,将和当年‘会用搜索引擎’‘会保护密码’一样,成为数字时代的基础素养。”

未来的攻击,可能不再需要黑客
“未来的竞争对手网站可能不再为人类优化内容,而是专门设计‘机器内容’。”
/ 04
当搜索、采购、交易和邮件处理越来越多地由Agent完成,互联网也会从人与人的信息网络,变成AI代理交互与博弈的网络。攻击者无需侵入系统,只要设计机器容易误读的信息,就可能影响另一个Agent的判断。
未来的“武器”可能不是病毒或恶意代码,而是精心设计的语义结构。攻击和防御都以机器速度运行,错误在Agent之间自动扩散,人类甚至来不及察觉。安全也必须从代码漏洞扩展到语义和行为漏洞。
“在Agent时代,‘没有人按下攻击按钮’不再意味着‘没有攻击发生’。”我们正在进入一个安全事件可以在无人作恶、无人知情、无人能及时干预的情况下自主发生的时代。
Agent化不可逆,真正的问题不是“AI是否危险”,而是“治理体系是否成熟”
“未来真正重要的是:人类是否还能定义AI的行为边界。”
/ 05
面对上述挑战,一种本能的反应是恐惧和抵制——呼吁暂停AI Agent的开发,或施加严格的监管壁垒。但这种反应虽然可以理解,从历史经验看,技术演进的力量从未被简单的禁止所阻挡。
回顾互联网发展史,早期互联网同样充满了安全真空——没有加密的通信协议、没有身份验证的交易系统、没有治理框架的数据流通。但人类逐步建立了HTTPS、云安全架构、零信任模型、GDPR等一系列治理基础设施。这些制度和技术的叠加并没有阻止互联网的发展——它们使互联网的发展成为可能。
Agent时代同样需要这样的治理基础设施:新的标准、新的协议、新的监管、新的教育。
“过去,互联网连接了信息。下一代Agent网络,将开始连接行动。而AI安全也将第一次从内容安全,进入行为安全时代。这不是终点——这是一个全新秩序的起点。”
可在微信小店购买纸刊
也可扫码在线阅读

扫码进入#07期《WAIC UP!》
解锁10篇AI时代最实用的解决方案
Hello:
世界人工智能大会(WAIC)推出首份刊物《WAIC UP!》,一部「AI时代进化指南」。
WAIC UP! WAKE UP MORE!
我们邀请全球AI及跨领域的先锋力量,共同释放思考的力量与智慧的主张,旨在唤醒更多人,探究关乎技术跃迁、自我边界和未来文明的无限可能。
准备好!释放你的思考,觉醒你的行动,与我们一同探究那些尚未显现的可能性,勾勒以人为中心的未来智慧文明全景图!










