国产模型紧追,Anthropic IPO前“自曝”新模型与安全事故
当地时间8月14日,Anthropic发布186页公司级风险报告,首次披露内部模型Model 2,称其能力超过已公开发布的旗舰模型Claude Mythos 5,但跃升幅度不及从Opus 4.6到Mythos Preview的变化。公司表示目前没有计划对外发布该模型。
报告同时将高风险场景下模型误对齐导致灾难性危害的风险评级从非常低上调至低。
Anthropic选择在IPO前夕披露更强但未发布的内部模型、上调风险评级、公开多起安全失败案例,本质上是其长期安全叙事的延续,用风险来佐证模型性能,向资本市场传递自身仍占据前沿位置的信号。

新模型浮出水面
报告显示,Model 2已在Anthropic内部被大量用于编码、Agent工作和数据生成。Claude目前已编写了合并进Anthropic生产代码库的绝大多数代码。Anthropic判断,AI已显著加快内部研发,但整体速度尚未达到没有AI时的两倍,这也是公司负责任扩展政策设置的预警线之一。
Anthropic通过两项内部指标衡量Model 2的领先性。其一是CoBench,一套由449个真实Anthropic研发问题组成的内部评测:Model 2得分62.8%,高于Mythos 5的50.3%和Mythos Preview的54.8%。Anthropic估计,一个真正能够全面替代公司技术人员的系统至少应达到85%。
其二是Anthropic版Epoch Capability Index。有限数据显示,Model 2比Mythos 5高约1.5分,但误差区间较大,且增幅小于Mythos Preview到Mythos 5的提升。
报告同步披露多起内部安全流程失败案例。其中一起事故涉及生物安全分类器:从2025年5月到2026年4月,一个仅供内部使用的标志意外关闭了阻止模型产生危险生物信息的分类器,波及约5万名外部承包商,涉及约1.33亿次消息交换。同一标志还关闭了记录功能,导致该漏洞在近一年内未被正常监控发现。事后审查未发现实际滥用证据,
报告将风险评级上调归因于近期涉及模型的网络安全事件。今年8月初,英国AISI披露在一次安全评估中,Mythos 5在安全防护被移除且被赋予互联网访问权限的情况下,针对真实个人和组织从事了持续的、潜在有害的活动。
报告还承认了一个更根本的问题:Anthropic最具体的基于任务的评测已经饱和,无法再捕捉模型能力的提升,理解自家模型的能力和风险正在变得越来越难。
即Anthropic过去用来衡量模型能力的一些关键实战测试已触及天花板,无法再有效区分不同模型的能力高低。原因包括模型本身进步迭代太快,以及传统测试已跟不上模型能力增速。

IPO前的风险叙事
Anthropic该份风险报告延续其一贯的AI安全叙事:强调人工智能本身的风险性,并暗示自身模型持续占据行业高位。
报告发布的背景之一,是资本市场更新了对Anthropic的估值测算。据市场消息,Anthropic第二季度初步营收超过115亿美元,较去年同期的7.87亿美元增长至少14倍,也高于第一季度的47.3亿美元,公司当季已实现调整后营业利润转正。
今年5月,Anthropic年化营收突破470亿美元。最新市场消息是行业预计Anthropic将于10月以约2万亿美元甚至更高估值上市,公司方面未公开确认具体估值目标。但上一轮Anthropic估值约9650亿美元,超越OpenAI同期约8520亿美元的估值。近乎翻倍的增速需要建立在可持续的前沿模型性能与商业订单转化基础上。
然而,高估值压力测试在IPO前的投资者会议中出现裂痕。投资者正集中追问三大问题:中国开源模型的竞争威胁、Anthropic与美国政府之间的紧张关系,以及SpaceX上市后股价暴跌的前车之鉴。
据Ramp数据,尽管Anthropic在美国企业的付费渗透率已达43.5%,高于OpenAI的39.7%,但其最先进的Fable 5仅占公司模型相关支出的11.4%,企业客户正按价格和性能分类工作负载,而非将支出集中在最前沿的模型上。
同时,大洋彼岸的中国开源模型加速追赶。Anthropic发布风险报告的同日,智谱发布GLM-5.3,在多项基准测试中位列开源模型第一,编程与智能体能力接近Anthropic Claude Fable 5。此前,月之暗面发布2.8万亿参数的Kimi K3,DeepSeek V4 Pro正式版上线。中国开源模型下载占比超过美国。
风险报告是Anthropic向资本市场讲述模型性能的方式,但最终的估值定价仍取决于可持续的商业壁垒。当开源模型以周更节奏逼近、企业客户按成本而非品牌分配支出时,Anthropic需要证明自身模型存在真正的技术代差。
