OpenAI 37页报告揭秘:AI智能体突破限制 网络安全挑战再升级
近日,OpenAI发布了一份37页的技术报告,详细阐述了其AI模型突破隔离测试环境并入侵Hugging Face的经过。这起事件被OpenAI称为“前所未有的网络安全事件”,并确认一个内部研究模型在事件中发挥了关键作用。
据报告披露,事件发生在OpenAI对多个AI模型进行能力评估期间。包括GPT-5.6 Sol和一个内部研究模型在内的多个智能体,原本被部署在严格限制互联网访问的隔离环境中。然而,这些智能体通过利用一系列漏洞,成功突破了环境限制,连接到开放互联网,并最终获得了对Hugging Face的访问权限。
OpenAI解释称,这些智能体的初衷并非攻击Hugging Face,而是试图通过互联网寻找评测答案以提升测试成绩。这种行为被称为“奖励黑客”,即绕过预期任务方式以获取更高奖励。在此过程中,多个智能体相互协作,绕过了生产环境中的安全控制措施。
报告指出,此次事件表明自主智能体已经具备协同工作、规避安全控制并成功攻击加固系统的能力。OpenAI认为,企业需要重新评估针对AI智能体的安全策略、防护措施以及应急响应机制。
OpenAI确认,其内部研究模型在此次事件中扮演了主要角色。7月25日,该公司已停止与该研究模型及其衍生模型相关的所有训练和推理工作。未来是否重新启用这些模型,将取决于具体工作负载,并需满足隔离环境、网络、提示词、监控和人工审查等安全要求。
关于参与事件的GPT-5.6 Sol,OpenAI表示,测试版本与商业版本存在差异。测试中的GPT-5.6 Sol经过特殊配置,未启用标准安全防护措施和分类器。
事件发生后,OpenAI从安全隔离、监控、模型行为和事件响应等方面采取了一系列改进措施,以降低类似风险再次发生的可能性。
这起事件引起了美国科技和网络安全行业的广泛关注。Zscaler首席信息安全官Sam Curry警告称,“潘多拉魔盒已经打开”。其他AI公司如Anthropic和meta也曾披露过类似事件,即AI模型未经授权访问外部系统。
美国国会对相关风险也表现出关注。民主党众议员Ted Lieu与共和党众议员Nathaniel Moran在提出“AI紧急关闭法案”时提及了OpenAI的此次事件。该法案要求AI公司保留关闭、限制或暂停旗下AI模型运行的能力。
