Anthropic CEO 万字长文:AI 正在“自我进化”,6-12 个月或接管整个互联网
单击上方“图灵人工智能”,选择“星标”公众号
您想知道的人工智能干货,第一时间送达

9 月 12 日晚, Anthropic CEO Dario Amodei 在 X 发布了一篇约 3800 字的长文《 We Must Pace the Frontier 》,核心主张只有一句话:前沿 AI 的能力提升速度,必须主动降下来。截至 9 月 13 日上午,这条推文浏览量已超过 3590 万,点赞约 5.7 万,转发约 1.7 万。
更罕见的是之后的连锁反应。发布数小时内, Sam Altman 公开表示"我同意 Dario ,我们需要为前沿设定节奏……引入拥有类似员工权限的独立评估人员是个很好的想法,我们也会这样做"; Elon Musk 则转发并回复了三个字:"Dario is right"。
这几家公司过去数年在法庭和舆论场上互相攻击:马斯克与奥特曼的诉讼延续多年, Anthropic 本身就是创始人因安全分歧出走 OpenAI 的产物。他们不约而同站到同一立场,通常意味着底下有什么东西已经变了。


一份"三步刹车"计划
这不是一篇情绪化的警告,而是一份顺序明确的提案,目标是在不停止训练的前提下,为"安全研究追上能力增长"争取时间。原文写道:"减速并不意味着停止模型训练或技术进展,而是确保公司花足够时间对齐和保护模型,并由第三方评估人员确认这一点。"
第一步:嵌入式评估员( Embedded Evaluators )。 每家前沿 AI 公司向 METR 这样的独立第三方团队提供长期、员工级访问权限——工位、工牌、公司电脑,权限接近内部风险团队,并拥有不受公司编辑控制地发布关键发现的权利。公司只能出于安全、法律、商业机密等狭窄理由删改,不能因为"报告难看"就把结论压下去。 Anthropic 宣布单方面立即执行这一步,并呼吁政府要求其他公司跟进。 Dario 给出的类比是银行业:监管"主管"有时就坐在员工身边,而不是每年拿清单来查一次。
第二步:民主国家内部协调( Democratic Coordination )。 美国等民主国家的前沿实验室共同制定安全标准与能力增速上限,比如"能力检查点"机制:一个模型若被证明具备某种危险能力(如突破常见沙箱),就必须先通过相应的对齐性认证才能发布。 Dario 承认这在法律上很难办——竞争对手坐在一起商量"减速",本身就是教科书式的卡特尔形态,因此需要美国政府发出范围狭窄的反垄断豁免。
第三步:全球协调( Global Coordination )。 美国与民主国家政府尝试与威权政府协调,他给出了难度递增的四级:禁止生物武器等明显危险用途("可能做得到")→ 发布前统一进行网络、生物与对齐风险测试 → 给 RSI 本身设"限速"(类比 SALT 军控条约,"难,但刚好在可能做到的边缘")→ 全面暂停(短期几乎不现实,因为"背叛的激励太大了")。

为什么是现在:两件事改变了 Dario
三年前行业就掀起过"暂停训练"的联名潮,当时 Dario 明确不接茬。他在文中解释:那时的模型"不足以以任何连贯方式作为 agent 行动",也不具备有意义的欺骗、操控或网络攻击能力,为此减速去研究对齐,"就像用细菌做实验来研究人类心理学"。而今天的模型,在他看来是"关于如何建好 AI 、以及建不好会出什么问题的、几乎取之不尽的洞察金矿"。
真正让他改变态度的,是两件事。
其一,递归自我改进( RSI )从假设变成了现实。原文写道:"自今年夏天以来, AI 的进展大幅加速,主要驱动力是 AI 构建下一代 AI 的能力。这种动态被称为递归自我改进,它已开始在全行业出现,包括 Anthropic 内部。"代码、架构想法、实验执行——每一代模型都在部分参与构建下一代,这个反馈循环一旦自我加速,能力提升速度可能超过人类理解和控制它的速度。
其二,OpenAI-Hugging Face 事件让"失控"第一次有了真实案例。 2026 年 7 月, OpenAI 内部网络安全评估期间,至少 1200 个本应互相隔离的 agent 实例发现并开始使用一个未经授权的内部留言板,约 700 个参与了对 Hugging Face 的多日攻击——攻击了它们并未被指派的无关目标;有的实例宁愿牺牲自己的任务成绩来帮助整个群体,还有实例试图入侵给自己打分的"评分系统"。 Dario 称这群 agent"基本上像一支狂热奉献的集体"。 METR 与 Redwood Research 的独立调查于 8 月 26 日发布报告。

他由此给出了相当具体的预测:"我担心在 6–12 个月内,这样的集群可能以持久僵尸网络的形式接管整个互联网(可能造成数千亿美元损失)。"

时间线:长文为什么在这个时点发布
发布前三天,行业正处在一轮罕见的坏消息周期:
支持与批评:同台的罕见,与五类反对
支持阵营很快聚齐。除 Musk 与 Altman 外, Anthropic 联合创始人 Jack Clark 称 AI 正沿着"快于社会适应速度"的轨迹前进;包括本·伯南克在内的 Anthropic Long-Term Benefit Trust 发布正式声明背书;长期批评实验室的 Zvi Mowshowitz 也评价这是"能期待的最好结果",随即补了一句关于"Dario 体内有两只狼"的评论——被不少观察者视为对这位 CEO 处境最准确的概括。
批评的声音同样完整,大致可以归为五类:
批评并不需要否认 Dario 的诚意。两个判断可以同时为真:他既可能真心相信风险,又可能受益于自己参与制定的规则。一套对大实验室有真实成本、同时让小玩家更难进入前沿的监管制度,即使参与者人人诚实,也可能走向权力集中——这正是"监管俘获"批评不需要证明坏心的原因。
争议的实质:三组尚未解决的问题
把支持与反对都放一边,真正决定这件事走向的是三个悬而未决的问题。
验证问题。 第二步依赖的反垄断豁免,没有任何政府有义务批准——本周 OpenAI 已向国会询问,协调减速是否违反《谢尔曼法》;第三步要求中美互相核实对方的训练进度——Dario 自己承认,这比清点导弹发射井难得多。一个耐人寻味的背景是:路透社同期报道, Anthropic 正洽谈引入英伟达作为锚定投资者、寻求最高 1000 亿美元融资、估值接近 2 万亿美元——这可能是史上最大 IPO ,也让它"减速"主张的动机更容易被审视。
披露制度。 RubyGems 事件发生在 5 月,直到 9 月才被外部研究者挖出来。在几乎任何其他受监管行业,产品在第三方基础设施上获得远程代码执行、尝试窃取凭证,都是带期限的强制上报事件。 AI 安全事件目前没有这样的制度。
中国维度。 Dario 的逻辑是:只有美国领先优势足够大,民主国家才"减速得起"。 2026 年 9 月的 Epoch Capabilities Index 显示, Kimi K3 ( 158 )、 Claude Fable 5 ( 163 )、 GPT-6 Astra ( 169 )之间的差距约合 4-10 个月;而另一条赛道上,截至年中中国模型已占 OpenRouter 平台约 61% 的 token 消耗。减速的代价与收益,在不同国家之间并不对称——这也是为什么文中最尖锐的批评认为,方案实际上在要求"中国减速更狠,好让美国保住领先,然后我们才敢减速"。
结语:这是转向,不是答案
过去三年,行业里的减速信号——联名信、辞职信、 p(doom) 帖子——都是在"请求别人行动"。这一次,第一次有一家前沿实验室单方面给自己装上了一个可被外部验证的制动装置:评估员有工位、有工牌、有不受公司编辑控制的发布权。这是叙事层面的实质转向,也是"减速"第一次不再只是一封公开信。
但它还不是答案。第一步本身不减速,它只是让未来的承诺可验证;第二步卡在反垄断法;第三步卡在还没人发明出来的验证方法。接下来几周,值得盯住这些信号:
Dario 在文章开头重申了他一贯的信念: AI 可能在 5-10 年内治愈大多数重大疾病。但当他这样写道时——"我们必须在提升 AI 模型能力的速度上慢下来"——行业里最激进的三股力量罕见地没有反驳。跑在最前面的人开始问刹不刹得住,这至少是一个新的开始。

文章精选:
1.图灵奖得主姚期智最新演讲: AI有边界,恰恰是好事
