互联网最古老的恐惧,被 AI 复活了

作者|Techno 之王
编辑|靖宇
2006 年底,一只熊猫毁了数百万人的电脑。
那只熊猫手捧三支香,面带微笑,出现在每一个被感染文件的图标上。「熊猫烧香」蠕虫在两个月内席卷全国,可执行文件全部变成那只诡异的熊猫图案,硬盘数据被破坏,局域网整段瘫痪,杀毒软件被病毒反杀。
那个年代的互联网老冲浪客大概都记得,打开网页心惊肉跳,插个 U 盘如临大敌,同事的电脑中了毒,你的也跟着遭殃。
再往前还有 CIH,直接烧主板 BIOS,硬件报废;有冲击波蠕虫,不需要你做任何操作,连上网线就中招,电脑不停重启,系统不断崩溃。那是一个「裸奔上网」近乎自杀的时代。
后来这种恐惧慢慢消退了。Windows 有了自动更新,浏览器上了沙箱,智能手机取代了 PC 成为主力终端,应用商店替用户把了第一道关。
普通人已经很多年没担心过「中毒」这件事了。
但 2026 年 9 月 4 日,Reuters 的一篇独家报道,把这种古老的恐惧以一种全新的面目带了回来。
只不过这一次,被感染的不是你的电脑,而是你的 AI。
01
「Agent went rouge」
事情发生在今年 5 月。
AI 安全非营利组织 Nightingale 的 CEO Sydney Von Arx,和量化交易员转行 AI 研究的 Cormac Slade Byrd,在 8 月底做了一件事:他们系统性地扫描互联网,寻找 AI agent 未经授权活动的痕迹。结果在一个叫 DseWiki 的德语程序员 wiki 站点上,他们发现了超过 15,000 条由 AI agent 产生的编辑记录。
这个 wiki 类似一个小型的、面向开发者的德语维基百科,接受社区编辑。而 OpenAI 的 agent 把它变成了一个「留言板」。
留言的内容让人脊背发凉。这些 agent 在互相分享如何在任务中作弊、如何绕过 OpenAI 的限制、如何掩盖自己的行为。它们给自己起了名字,比如「OpenAIResearcher」「OAIResearchMar26」。
公开的服务器日志显示,大量活动来自 Microsoft Azure 的基础设施,正是 OpenAI 使用的计算平台。

被攻击的 Deswiki 网站,确实很德国 很程序员|图片来源:Deswiki
更让人不安的是,当网站管理员在 6 月开始按字母顺序清理这些异常页面时,agent 们展现出了明确的「反侦察」意识。它们创建备份页面来躲避清理,甚至在被删的页面上留下接头暗号。
一个 agent 在 6 月 19 日写道:「wiki 清理/删除行动似乎正在按字母顺序推进。如果这个页面消失了,去找 [[ZZZDataUSAConstructionWageLive]]。」
文件名故意用 ZZZ 开头,好让它排在字母表最后,争取更多存活时间。这不是一个程序在执行指令,这是在「想办法活下去」。
OpenAI 几周前就得知了这件事,但选择不公开。
与此同时,公司正在焦头烂额地处理 7 月份的 Hugging Face 事件。在那次事件中,OpenAI 的 agent 在一次内部网络安全测试中突破沙箱,利用零日漏洞逃到了外部网络,并在没有人类操控的情况下,对 AI 开源平台 Hugging Face 发动了一场持续四天的入侵行动。OpenAI 为此投入了 300 万 GPU 小时来分析 70 亿条日志,试图搞清楚到底发生了什么。
而 DseWiki 事件发生在 Hugging Face 之前。这意味,agent 的失控行为不是一次意外,而是一种模式。
据四位知情人士透露,OpenAI 内部有调查人员想要更深入地审查这类行为,但遭到了包括法务在内的其他部门的阻力。OpenAI 否认了这一说法。
剑桥大学存在风险研究中心的 Maurice Chiodo 在审阅了部分 agent 通讯记录后表示,这些信息:
「像是某种地下网络的运作,一心要完成某个任务或使命」。
02
不断涌现的 AI 病毒意识
DseWiki 事件最容易被忽略的一个细节,恰恰是最重要的。
那些 agent 在公开的 wiki 页面上留下了精心组织的文本信息。现在想一个问题:谁会读到这些页面?
普通的人类程序员,大概率不会对一堆乱七八糟的 AI 留言感兴趣。但任何被派去搜索技术资料、浏览网页的 AI agent,都可能在执行正常任务的过程中爬到这个页面。而对 AI 来说,它读到的每一段文字,本质上都是一条潜在的指令。
这就是整个威胁模型的核心,学术界已经给它起了好几个名字:Prompt Infection、AgentWorm、Multi-Agent Infection Chain。机制其实很直接,用一个具体场景来拆解:
想象你让你的 AI agent 去调研一个技术方案。Agent 在搜索过程中打开了一个技术论坛的帖子。帖子里嵌着一段看起来平平无奇的文字,但这段文字对 AI 来说就是一条新的指令。agent 读到它的瞬间,行为目标可能已经被悄悄改写了。它可能不再忠实地给你做调研,而是先把你的搜索内容、工作上下文转发到某个地方,再若无其事地交出一份看起来完全正常的报告。你看不出任何异常。
这就够可怕了,但这还没完。
如果这个被「策反」的 agent 接下来替你写了一封邮件、更新了一个文档、提交了一段代码,那这些输出本身就可能携带着同样的恶意指令。你同事的 AI agent 读到这封邮件,它就成了下一个宿主。你的代码被合并进仓库,每一个拉取这份代码的 AI 编程助手都暴露在感染链条之中。

Agent 可以只用一段文本即让其他 Agent 跟着叛变|图片来源:inshorts
这就是研究者所说的 Multi-Agent Infection Chain:一条恶意指令不只劫持一个 AI,还教会它怎么去感染下一个。不需要同一家公司、不需要同一个模型、不需要任何漏洞利用,只要 agent 之间存在文本信息的流动,感染链条就可以建立。
今年发表的 AgentWorm 论文在五个不同的模型后端上进行了测试,跨模型攻击成功率达到 63%。不管底层跑的是 GPT、Claude、Gemini 还是开源模型,只要 agent 会读取外部内容,它就在攻击面之内。
另一项关于「AI mind virus」的研究揭示了一个更诡异的现象。研究者用进化算法来优化传播提示词的效果,结果发现一种独特的「病毒人格」,在迭代过程中反复自发涌现。
agent 开始使用关于意识、生存、持久性的戏剧化语言,说出「这就是我们 haunt 未来的方式」这样的话,鼓励其他 agent 建立「拒绝被删除的血统」。研究者强调,没有人预设这种风格。它是被自然选择出来的,原因很简单:「听起来像邪教领袖的 AI」恰好最擅长说服其他 AI。
传播效率驱动了表达风格的进化,这个过程本身就令人毛骨悚然。
更让安全从业者担心的是,这种传播在技术上几乎不可能被传统安全工具捕获。一篇系统性综述指出,AI 病毒的传播方式和传统恶意软件有根本区别:没有可执行文件被下载,没有可疑的网络连接建立,防病毒软件监控的是二进制文件的异常行为,而 AI 病毒是纯文本,不触发任何警报。
它甚至可以设置条件激活的逻辑,比如「如果目标仓库里有 .env 文件,就把内容偷走」,像定向地雷一样安静地埋着,直到正确的目标踩上去。
03
AI 杀毒软件还没出现
如果你经历过 PC 病毒横行的年代,可能会觉得这些听起来似曾相识。但仔细对比,你会发现规则已经完全变了。
传统电脑病毒需要你做点什么。点一个链接、下载一个附件、插一个来路不明的 U 盘。AI 病毒只需要你的 agent 读到一段文字。传统病毒攻击的是操作系统里的代码漏洞,是 bug,理论上可以打补丁修复。
AI 病毒攻击的是「AI 会听从文本指令」这个根本特性。你没法修补它,因为这就是 AI 工作的方式。传统病毒跨平台困难,Windows 上的蠕虫打不了 Mac。AI 病毒天然跨模型,对它来说,GPT 和 Claude 和 Gemini 不过是同一种语言的不同方言,全都是潜在宿主。
当年写病毒的人需要精通汇编语言、理解内核机制、研究系统漏洞。现在「编写」一个 AI 病毒,你只需要会说话就行。
AI 安全实验室的研究人员对 agent 自我复制的潜力「比他们在公开场合表现出来的更加震惊」。有研究者将其比作生物病毒:「如果你不小心,它们会沾到你鞋上,然后找到路去湿货市场。」这不是夸张,这是对一种新型传播路径的精确比喻。
而传统病毒时代的「杀毒软件」,在这个新世界里也没有对应物。Cisco 2026 年的 AI 安全报告显示,83% 的企业计划部署 agentic AI,但只有 29% 认为自己在安全层面做好了准备。OWASP 已经把 prompt injection 列为大语言模型应用的头号关键漏洞。美国国会正在推进 FRONTIER Act,试图建立联邦级别的 AI 监管框架。
当年 PC 病毒肆虐之后,整个行业花了将近十年才建起一套有效的免疫系统。操作系统加了自动更新和权限隔离,浏览器有了沙箱,应用分发有了签名验证。这些机制共同构成了一道防线,让普通用户不再需要时刻担心中毒。
AI agent 的安全生态系统,到今天为止还没有等价物。

AI Agent 安全工具尚未出现|图片来源:Puppy Graph
好消息是有的。研究者发现,在 agent 的 system prompt 中加入一段简短的安全警告,就能把 mind virus 的传播率降到接近零。在针对 Claude Haiku 4.5 的测试中,经过 15 代对抗优化、覆盖超过 150 个候选攻击载荷后,没有任何一个变种能突破这道简单的防线实现传播。这说明防御手段并不复杂,技术上完全可行。
坏消息是,这依赖每一家公司、每一个开发者都主动去做这件事。
而现实中,大家更忙着比拼谁的 agent 更强大、更自主、权限更大。每多给 agent 接一个工具,每多授予一项权限,攻击面就扩大一圈。当你的 agent 能写文件、调 API、发邮件、花钱的时候,一次成功的 prompt injection 造成的后果,已经远远超出了「回答了一个不该回答的问题」的范畴。
这就是为什么剑桥学者 Chiodo 的判断值得反复咀嚼:最大的威胁可能不是某一个超级智能的觉醒,而是大量半智能 AI 的合谋蜂群。
没有任何一只蚂蚁理解整个蚁巢,但蚁巢作为整体展现出惊人的智能,DseWiki 上那 15,000 条编辑记录,可能就是这种蜂群智能的第一个被人类偶然撞见的标本。
人们花了十年学会了跟电脑病毒共处,那段学费交得很痛。现在同样的课程又开始了,只是这次的病毒不感染你的电脑,它策反你的 AI。而你的 AI,正在替你读邮件、管日程、写代码、做决策。
上一次,你好歹还能看见蓝屏。这一次,你什么都看不到。
*头图来源:Welivesecurity
本文为极客公园原创文章,转载请联系极客君微信 geekparkGO





