Anthropic联手埃森哲试水新安全评估机制,第三方评估人员进驻AI研发内部
发布时间:2026-09-19来源:环球网科技
【环球网科技综合报道】9月19日,据外媒CNBC消息,AAnthropic日前宣布与全球咨询企业埃森哲达成合作,推出业内少见的嵌入式独立安全评估机制,对Claude等前沿大模型开展深度安全审计,强化前沿人工智能风险管控能力。
本次合作由埃森哲AI业务部门Faculty主导,工作覆盖大模型红队攻防测试、AI对齐校验、安全护栏有效性验证等多项安全任务。按照规划,未来五年Anthropic与埃森哲双方将各自投入至少10亿美元,持续建设AI安全评估体系,完善评测能力建设。
不同于传统只拿到模型输出结果的外部第三方测评,本次采用的嵌入式评估模式,允许埃森哲的安全评估人员获得接近企业正式员工的内部访问权限。评估人员可以深入模型训练全流程,观察模型迭代,追溯研发与上线的内部决策,直接和研发团队沟通,以此识别传统外部测试难以发现的安全盲点,核验企业安全承诺落地情况,并向社会公开风险相关信息。
目前该创新评估模式仍处于摸索阶段,不少落地细则还在进一步敲定。业内分析表示,嵌入式评估是大模型安全治理的全新尝试,但也将面临独立客观性、数据权限管理等诸多现实挑战。(旺旺)
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。
