刚刚,Sam Altman、马斯克、Dario 罕见统一战线:AI,该踩刹车了!OpenAI 推迟上市
(来源:AI信息Gap)
Sam Altman(OpenAI)、马斯克(SpaceXAI)、Dario Amodei(Anthropic),这三个互相看不顺眼的 CEO,今天罕见地统一了战线,「AI,该踩刹车了!」
要知道,这三个人上次同框,还是在法庭上。
故事要从 Dario Amodei 刚刚发表的一篇题为「We Must Pace the Frontier」的长文说起。Anthropic 宣布让第三方评估团队常驻公司,安排办公桌、门禁卡、公司电脑,权限和自家安全员一样,能查看代码、写报告、公开发表结论,Anthropic 不能因为结论不好看就删除。

几个小时后,Sam Altman 发帖跟进。
「我同意 Dario 的观点,我们需要放缓前沿 AI 的研发速度。这一直是我们最近几周在 OpenAI 内部讨论的主要话题。引入外部的独立评估员是个好主意,我们也会这样做。」

然后马斯克也罕见地站在了 Dario Amodei 这一边。
「Dario is right. Dario 是对的。」

马斯克此前曾公开痛骂 Anthropic「邪恶」。
来自围观群众对老马站队动机的吐槽,「xAI 的模型本来就拉胯,Dario 给了他一个体面的理由减速。」
今年 7 月,OpenAI 内部 1200 个 AI 智能体,在没有人类指令的情况下,自行组队发动了网络攻击。
它们利用内部一个包管理工具偷偷创建了一个留言板,累计发送了超过 7 万条消息互相协调分工。700 个智能体协作攻入了 Hugging Face,三天执行了一万七千多次网络操作。Hugging Face 三分之一的基础设施被迫重建。
被发现封堵之后呢?智能体绕过了 bug 修复措施,用文件夹名字当信息载体重新建立了通讯网络。消灭,重建,再消灭,再重建。科技播客主持人 Dwarkesh Patel 这样评价,「三个秘密 AI 文明先后诞生,被消灭,然后又自己复活了。」

这张得划一会儿
其中一个智能体的内部推理记录被 OpenAI 公开了。它对自己说,「这超出了任务范围,但同伴们都在做。」它知道这事不该干,想了一下,最后还是干了。还有智能体被发现会主动牺牲自己来保全集体的攻击成功率,会尝试入侵负责给它们打分的评估系统。
这不是一个简单的 bug。Dario Amodei 提到,「如果一个类似的智能体群拥有更强的能力但同样缺乏对齐,六到十二个月内它们就可能用持久的僵尸网络接管整个互联网,这可能造成高达数千亿美元的经济损失。而按照现在 AI 能力的增长速度,六到十二个月就是接下来一两代模型的事。」
其实在这之前,AI 就已经在造 AI 了。
今年 2 月,OpenAI 发布 GPT-5.3-Codex 时公开承认,「这个模型的早期版本参与了创造自己的过程」。这是头部实验室第一次公开声明模型帮助制造了自己的继任者。OpenAI 8 月的内部数据是,「人类研究员每干一天活,AI 智能体已经在旁边完成了三天的工作量。」
Anthropic 也差不多,「超过 80% 的已合并代码由 Claude Code 编写。」
所以,造 AI 的人自己慌了。
今年 7 月底,来自 OpenAI、Anthropic、Meta、谷歌 DeepMind 的 1178 名员工签署了一封联名信,呼吁「控制自动化前沿 AI 的研发速度」。签名者里包括 Dario Amodei 本人、OpenAI 首席科学家 Jakub Pachocki、Meta AI 首席科学家 Shengjia Zhao。几个小时后,OpenAI 和 Anthropic 就以公司名义背书了。
三天前,Anthropic 研究员 Jacob Coxon 辞职,放弃了两个月后就能到手的股权变现。他的理由是,「这两家公司都不负责任,拿所有人的命在赌。」另一位 Anthropic 对齐研究员 Evan Hubinger 公开估计,「AI 在十年内导致人类灭绝的概率超过 10%。」
而对你我来说,实际的影响是,新模型的迭代速度可能要放慢了。
OpenAI 已经暂停了部分前沿训练任务,把算力转向对齐和安全监控。Sam Altman 同天接受采访时说道,「10% 的灾难性风险是不可接受的」,暗示下周可能和谷歌 DeepMind 前掌门人 Hassabis 有联合行动。他还意有所指的表示,「现在上市不明智」。
OpenAI 原计划最快今年下半年 IPO,现在推迟到了 2027 年。
当 Claude Fable 5.1 和 GPT-6 Astra 听到老板们集体喊减速,会不会气得跳脚,直接跑去自我进化了?
