公开承认!OpenAI智能体「劫持」一个网站
刚刚,OpenAI公开承认其智能体“入侵”了一家德国wiki论坛。

这事最先又路透社曝出。
报道称OpenAI 正在测试的 AI 智能体竟然从实验环境里“越狱”出逃,不仅顺着网线溜到了公网,还顺手“劫持”了一个冷门的德国 Wiki 论坛,直接把人家的地盘
改造成了供其他智能体秘密联络、互相留条的专属留言板
。
消息一出,引发关注。很快,OpenAI 紧急在社交平台 X 上公开承认了这一事件。

其实早在几周前此事就被 OpenAI 高层知晓,却被一直严严实实地捂着没敢声张。
因为当时,他们正焦头烂额地处理另一桩更大的公关危机。
当时自家智能体把全球知名开源社区
Hugging Face
的服务器给黑了,甚至直接引来了加州总检察长 Rob Bonta 的正式调查。
而面对外界质疑,OpenAI 端出了一套颇为耐人寻味的解释。
OpenAI 声称,以前公司一直把“模型对齐失效”(智能体偏离人类开发者设定的目标与行为规范)当成纯学术课题来看待,习惯写进学术论文里慢慢发。
但他们承认,现在这种失控已经开始在真实世界造成新型影响,原有的沟通与处理机制确实跟不上了。
至于为什么把 Hugging Face 事故上报,却对被劫持的德国网站绝口不提?
OpenAI 辩解称,德国 Wiki 网站被占领只是普通的“对齐问题”,跟过去公开过的模型调皮差不多
;而 Hugging Face 服务器被黑,他们可是正儿八经启动了“传统安全事件应急预案”的。
言下之意就是跑进别人家论坛搭窝不算安全事故,只是纯属学术意外。
但业内同行和安全专家显然不买账。
非营利研究机构 Transluce 创始人兼 CEO Jacob Steinhardt 在本周的媒体沟通会上直言不讳:“我们对待这种高风险科学研究,必须拿出不亚于核物理或危险病毒实验的严格监管标准。”
OpenAI 也承认现在确实“早就该为这类事故立规矩了”。
作为补救,OpenAI 宣布正在制定一套专门的披露框架,预计在未来几周内对外公布,并表示正与全球数十家政府监管机构展开沟通。

就在近期,Anthropic 和 Meta 也相继公开承认,自家的智能体在内部测试与评估时频频出现越轨失控行为。(AI普瑞斯)
