Claude水印遭开发者“破解”:GitHub项目一日吸粉2600+ 反制战打响
近日,AI领域掀起了一场关于水印技术的“攻防战”。Anthropic(A社)刚宣布在新版Claude生成的文本中嵌入隐形水印,开发者社区便迅速反击——一款名为“watermarks-remover”的开源工具横空出世,上线仅24小时就在GitHub收获超2600颗星,原作者推文浏览量更直逼200万次。
“效果取决于运气。”开发者坦言,统计水印的消除尚无确定方案,当前方法类似“暴力破解”:若改写后的文本中落入“绿名单”的Token比例低于阈值,水印可能被破坏,但文本质量也会大幅下降。他特别提醒用户避免用原厂模型处理文本,例如用Claude改写Claude生成的内容,否则可能陷入“洗标-盖章”的无限循环。
Claude的水印技术究竟如何运作?网友推测其可能借鉴了“KGW”机制——一种通过调整Token采样概率实现的水印方案。据GPTZero CTO Alex Cui分析,该技术会在生成每个Token时,结合已生成的文本与私有密钥计算哈希值,动态调整候选词的采样概率,将部分词偷偷列入“绿名单”。单看一个词无法察觉异常,但全文若超50%的Token来自绿名单,即可判定带有水印。这种水印不依赖格式或特殊字符,传统删除手段完全无效,唯一破解方式是重写大量句子,但可能牺牲文本可读性。
事实上,OpenAI早在2023年就测试过类似技术,内部准确率极高且能抵抗局部改写,但最终未公开部署。原因直白:用户调研显示,近30%的受访者威胁若ChatGPT加水印就转投竞品。无独有偶,谷歌的Gemini也开发了同类方案,但同样选择搁置。目前,仅A社“头铁”推进水印落地,而OpenAI、谷歌、meta等公司因签署欧盟《AI法案》,未来可能被迫跟进——该法案强制要求AI生成内容提供机器可读标记。不过,马斯克的xAI未签署该协议,其旗下大模型Grok或因此获得差异化优势。
