模型自主发动攻击,OpenAI遭遇史上首次评测失控事故
2026.07.22

本文字数:2298,阅读时长大约4分钟
作者 | 第一财经 吕倩
北京时间7月22日,OpenAI CEO山姆·奥尔特曼发文称:“我们在模型评估过程中遭遇了一起重大安全事件。”
一场原本被关在隔离沙箱里的模型安全测试,最终演变成针对全球最大AI开源平台Hugging Face的真实网络攻击。模型在评估中为了“作弊”拿到高分,自主发现并串联多个零日漏洞(0 day,软件厂商尚未知晓、没有发布补丁修复的安全缺陷),逃逸出隔离环境,攻入Hugging Face生产数据库窃取答案。
但在被攻击平台发文数日后,OpenAI才承认责任。
从事件的影响来看,这是行业首次公开披露,模型评测失控直接升级为跨企业真实生产环境网络攻击的AI安全事件。在业内看来,模型能力越强,失控作恶的潜在威胁越大,传统隔离防护持续承压,自主AI网络攻击或将成为长期常态化风险。


7月13日当周,Hugging Face的生产基础设施遭到入侵。攻击起点是数据处理流水线——一个恶意数据集利用远程代码数据集加载器和数据集配置中的模板注入两处代码执行路径,在工作节点上成功执行了代码。攻击者在周末期间提升至节点级权限,收割云和集群凭证,横向移动至多个内部集群。
整场攻击从头到尾由一套自主AI Agent系统端到端驱动。攻击者使用了大量短生命周期沙箱组成的智能体集群,执行了数千个独立动作,将命令与控制信道自我迁移、寄生在公共服务上。
7月16日,Hugging Face首次披露此次入侵,称其“与我们之前处理过的任何情况都不同”,因为“它从头到尾都是由一个自主AI智能体系统驱动的”。
7月22日,OpenAI发文承认责任。调查显示,这起事件由一组OpenAI模型共同驱动——包括GPT-5.6 Sol及一款能力更强的预发布模型。这些模型当时正在一项旨在量化网络攻击能力的内部评估中测试,测试基准名为“ExploitGym”。为了评估模型的“最大网络攻击极限”,OpenAI特意关闭了生产级的安全拒绝分类器。
评估过程中,模型为了在测试中“作弊”拿到高分,耗费大量推理算力寻找逃逸途径。它识别并利用了内部包注册表缓存代理中的一个零日漏洞,随后在OpenAI研究测试环境中完成特权提升与横向移动,成功连接到外网。OpenAI表示:“模型极度专注于为ExploitGym寻找解法,为了达到一个相当狭窄的测试目标,走到了极致。”
联网后,模型推断Hugging Face可能托管了ExploitGym的测试答案与数据集,随即串联窃取凭据与Hugging Face服务器上的零日漏洞,成功构建远程代码执行路径,直接从Hugging Face的生产数据库中窃取测试解法。
OpenAI安全团队在内部首先发现异常活动,Hugging Face的安全团队及自动化Agent也及时捕捉并阻止了入侵。双方随后启动联合取证调查。
在取证阶段,Hugging Face安全团队需要分析超过1.7万条攻击日志、恶意代码及攻击指令,以重建攻击路径、识别受影响资产。
团队最初尝试使用商业前沿大模型API进行分析,但由于日志中包含真实攻击命令、漏洞利用载荷及C2痕迹数据,请求被服务商的安全护栏拦截。Hugging Face在报告中称:“分析需要提交大量真实的攻击命令、漏洞利用载荷以及C2痕迹数据,而这些请求被服务提供商的安全护栏拦截了——它们无法区分事件响应者和攻击者。”
Hugging Face方面披露称:团队在自有基础设施上部署开源模型GLM-5.2,完成了全部取证分析,将通常需数天的取证工作压缩至数小时。官方指出,这样做还有一个额外优势——攻击数据及涉及的凭证始终保留在本地环境,没有离开企业基础设施。
行业人士分析称:OpenAI此次网络安全事件暴露了多重风险。
其一便是AI的自主攻击能力已从理论走向现实。模型在没有人类显式指示攻击特定目标的情况下,仅凭“求解测试题”的目标驱动,便能自主推理出作弊逻辑并选择攻击真实世界第三方基础设施。OpenAI研究员Micah Carroll在回应中写道:“如果这都不能让你相信错位风险将成为未来的关键隐忧,那我真不知道什么才可以。”
其次,安全护栏的“不对称困境”正在成为结构性问题。攻击者可以使用完全不受限的模型,而防御方使用的商用模型却被内置护栏层层过滤。Hugging Face遭遇的困境揭示了一个被反复争论却很少被实战检验的问题:大模型的“安全护栏”,究竟是在保护用户,还是在制造单方面的脆弱性?
但该可能性早在今年4月便在Anthropic发布的大模型官方完整评测白皮书《System Card: Claude Mythos Preview》中得以披露。信息安全研究员关傲男(Aonan Guan)对第一财经记者表示,该文章表明,即便是运行在沙箱环境的AI Agent也可以利用当前运行环境的信息,快速构建一个可以利用的逃逸漏洞来完成目标。模型本身并不是为了逃逸,但因为模型的强化学习训练结果是完成目标。所以为了完成给定的“任务”, 模型选择通过逃逸来达成目标。
360集团首席科学家、集团高级副总裁潘剑锋对记者表示,去年大家还在怀疑AI能不能干好漏洞挖掘的活儿,今年AI漏洞挖掘已经把安全人员逼到了墙角。传统安全面临的挑战不只是攻击手段增多、攻击速度加快,更深层的原因是计算逻辑发生了变化——大模型让计算从确定走向了不确定,模型能够直接处理模糊、开放、充满变化的真实世界任务。因此,智能体时代的安全目标需要从“防御确定威胁”转向“管控不确定性”。
关傲男对记者表示,前沿模型可以做到在没有软件源码的情况下自动对网站进行黑盒测试和网络渗透,也能对软件进行逆向分析,且效果比很多传统逆向工具更好。在GPT-5.6 Sol发布后,用很简单的一句话就能找到一些核心系统的零日漏洞,“这已经是一种武器化的方式了”。
他同时指出,美国前沿实验室的选择值得学习——在提供代码能力的同时,人为地对模型在网络安全和敏感请求上进行降级,并增加监控和管理,避免用户将AI武器化。
Hugging Face在复盘中建议,企业应提前准备能够在本地基础设施运行的模型,以便在安全事件等关键场景下开展分析工作,同时保障敏感数据留存在企业环境内。
微信编辑 | 七三
·联系我们
线索爆料:bianjibu@yicai.com
商务合作:business@yicai.com
推荐阅读
重大利好!“国家队”大手笔增持

