Anthropic发布《人工智能滥用检测与应对》报告

图丨Pexels
9月10日,Anthropic公司发布的报告《人工智能滥用检测与应对》(Detecting and Countering Misuse of AI)指出,过去八个月中,Anthropic威胁情报团队发现并阻止了多起威胁行为者试图利用Claude开展恶意活动的行动。报告分享了关于这些行动的案例研究,介绍了自其于2025年3月、8月和11月发布前几期威胁报告以来,Claude的恶意使用方式发生了怎样的变化。
报告涵盖了Anthropic在2025年12月至2026年8月期间阻止的活动,涉及七类危害领域:网络行动、影响行动(操纵信息环境的行动)、监控行动、诈骗与欺诈、生物滥用、常规武器开发以及模型蒸馏。
相关活动使用了Claude的Haiku、Sonnet和Opus模型。除一起非法模型蒸馏案例外,所有滥用案例均未涉及Claude的Fable或Mythos级模型。
Anthropic称其在报告中分享的案例并不代表典型的滥用行为,但是其迄今发现的最值得关注、最具新颖性的威胁活动案例。Anthropic认为自身有责任披露针对其服务的恶意滥用行为。随着模型能力不断增强,如果人工智能开发者和社会中的防御力量不采取行动提高其安全性,相应风险也将随之上升。
报告涉及的威胁行为者包括疑似由国家支持的团体、以经济利益为动机的犯罪分子、商业间谍软件供应商、国家宣传机构以及具有政治动机的个体。相关案例既包括一个旨在欺骗用户的虚假约会应用网络,也包括用于识别和监控异见人士的监控系统。
技术成熟且具有持续行动能力的威胁行为者会不断测试安全防护措施,并试图绕过用于发现和防止滥用行为的技术手段。Anthropic称其将继续改进安全防护措施,并与合作伙伴开展协调,以提高发现、阻止和预防未来滥用行为的能力。
资料来源丨Anthropic
本文由生物安全情报网编译,仅用于学术分享,转载请注明出处
阅读原文献请点击“阅读原文”
