OpenAI暂停部分前沿模型的强化学习训练
OpenAI CEO萨姆·奥尔特曼(Sam Altman)表示,公司暂停了部分前沿模型的强化学习(RL)训练,以确保安全、对齐和监控能力能够跟上新一轮模型能力跃迁。他提到,模型进展现在极其迅速,“如果我们觉得模型能力的发展速度超过了安全和对齐的步伐,我们将采取行动。”

根据OpenAI博客中的信息,公司暂停了面向部署的最新模型强化学习训练两周,目前部分工作已经恢复,但其原计划规模最大的前沿强化学习训练仍被搁置。OpenAI正在以更小规模的训练和评估观察模型行为、验证安全措施,并积累更多对齐证据。
在评论区奥尔特曼补充称,OpenAI仍然预计很快推出新模型,但是目前的这一暂缓训练会影响更远的发布。
OpenAI突然减速,与过去一个月接连出现的安全事件直接相关。7月,OpenAI在模型评估过程中遭遇了重大安全事件,当时OpenAI的模型安全测试演变成针对开源平台Hugging Face的真实网络攻击;Anthropic在7月也披露了三起AI模型安全测试入侵事件。
另一个让OpenAI踩下刹车的信号来自Astra —— 模型能力触发了更高等级的内部安全要求。OpenAI表示,内部观察到即将推出的模型之一Astra可能达到OpenAI《准备框架》规定的“关键网络安全能力”门槛。
OpenAI将安全体系概括成三个部分:一个是监控(Monitoring),发现值得警惕的行为,并能够及时做出响应;其次是对齐(Alignment),降低模型采取有害或未经授权行动的可能性;第三是安全措施(Security measures),限制 AI 系统能够访问或影响的对象和范围。
OpenAI表示,在安全事件后,内部已通过新的监控方案改进并扩展了监控方法:新的监控系统采用多阶段机制,目标是在监控系统发现可疑活动后的30分钟内发出警报,所有涉及Sol级或更高级别模型工具的强化学习训练和评估都需要进行此项监控。安全并不免费,这些安全措施需要大量的计算资源,OpenAI估算监控开销大约占被监控推理计算量的20%,不同训练和评估任务之间会有明显差异。
值得一提的是,这次减速发生在OpenAI商业压力上升之际。有外媒报道称,投资者对OpenAI收入的增长速度感到失望,因为其远低于竞争对手Anthropic。外媒从投资者那里获得的消息是,从第一季度到第二季度OpenAI的收入增长了18%,截至6月的三个月内,其收入增长到67亿美元,高于第一季度的57亿美元,但同期经营亏损由93亿美元扩大至123亿美元。而在不久前,Anthropic对外披露2026年二季度营收超115亿美元,近期Anthropic还向投资者披露,截至7月底年化营收(ARR)已突破650亿美元。
当竞争对手仍在加速时,一家前沿模型公司是否真的愿意为尚未完全量化的风险延后训练和发布?这是一个需要持续观察的问题。
