刚刚,Claude文字水印细节全曝光,官方检测工具即将推出
发布时间:2026-08-15来源:APPSO
就在刚刚,Anthropic 正式发文解释了 Claude 文本水印的工作方式。按照官方说法,为了满足欧盟对 AI 生成内容机器可读标记的要求,Anthropic 最终选择了 Google DeepMind 的 SynthID-Text 路线。由于目前还缺少可靠的区域区分方案,这套水印上线后还会直接应用到全球 Claude 用户。至于水印咋加、能不能洗掉、拿 Claude 润色人类文章算不算、代码有没有中招、翻译咋办、未来咋检测…… 好家伙,大家关心的这些雷点,Anthropic 这波倒是基本全回答了一遍。Anthropic 试图向大家疯狂暗示:放宽心,水印对 Claude 几乎没有实际影响。但通篇看下来,比较难评的是博客描述文字水印的影响时疯狂叠 Buff 的几个限定词: 「大体相同」、「没有统计学显著差异」、「影响可以忽略」、「速度影响可以忽略」……几乎没有影响终究不等于完全没有影响。就算眼下的跑分评测很难观察到明显的质量差异,也很难据此断言这种影响在所有任务、所有文本长度和长期使用中,都可以完全忽略。尤其当水印真正进入 Claude 的日常生成以后,它是否会在某些场景中牺牲一点生成质量,最终影响用户体验,恐怕还需要打一个大大的问号。这种机制可以用来判断 Claude 参与撰写某段文本的可能性。为了遵守《欧盟人工智能法案》,我们正与其他几家主要 AI 提供商一起实施这一改变。在本文中,我们会回答一些收到较多的问题,包括我们选择的水印方法如何工作、它是否会影响 Claude 的输出,以及我们为什么要做出这一改变。我们使用的水印方法,在实际使用中不会对 Claude 输出的质量或内容产生影响;水印不需要额外消耗 Token,因此也不会增加使用成本;水印不携带任何身份信息,无法追溯到某个具体的人、组织或聊天记录;水印也不会是 Claude 独有的机制。自 8 月 2 日起,欧盟要求面向其市场提供服务的 AI 提供商对 AI 生成内容进行标记。其他主要模型开发商也签署了同一份《行为准则》,并将实施各自的水印方案。像 Claude 这样的大语言模型,是通过一次生成一个词来工作的。模型每次决定下一个词时,都会从一组可能的候选词中进行选择,最终根据前面的文本,选出最合理或概率最高的那个。在大多数情况下,模型最终选了后面这两个词中的哪一个,对读者来说其实没太大区别,因为句子的整体意思基本一样。一段生成文本中会反复出现很多这样的选择,水印借此在 Claude 的回答中留下某种模式。读者无法察觉这种模式,但任何拥有对应密钥的人都可以检测出来。启用水印以后,模型做出的选择依然具有随机性,但随机性的来源发生了变化。模型不会再使用任意的随机数生成器来选择下一个词,而是利用密钥和前面的几个词,决定应该选择哪个词。换句话说,Claude 选择的词依然是随机的,但现在人们可以检查这一系列词语,判断它是否符合 Claude 在使用该密钥时会做出的选择。如果符合,就可以计算出这段文本由 Claude 生成的概率。需要强调的是,这并不意味着模型从此会一直偏向选择「阴沉」或「灰蒙蒙」。和没有水印时一样,根据前面的词,一句话里可能选「阴沉」,下一句话又可能选「灰蒙蒙」。水印机制也不会迫使 Claude 选择原本根本不会考虑的词。比如,它不会让 Claude 突然选用 「nubilous」 这样的词。这是一个非常生僻的「阴沉、灰蒙蒙」的同义词,正常情况下 Claude 几乎肯定不会使用它。对读者来说,带有水印的回答和没有水印的回答无法区分。从这一点来看,AI 水印和钞票、其他实体物品以及某些数字文档上的传统水印有很大区别,因为后者通常可以直接用肉眼看到。在内部测试中,我们没有发现水印会影响 Claude 文本的内容、创造力水平或可读性。介绍我们所使用技术的 SynthID-Text 论文 中,Google DeepMind 曾经专门测试过这种影响。他们让一部分 Gemini 用户使用开启水印的模型,然后比较用户给出的点赞和点踩评分。结果显示,与未添加水印的模型相比,两者之间不存在统计学上的显著差异。在另一项受控研究中,人类评分者将带水印和不带水印的回答并排比较,也没有发现质量上的差异。每一回合,玩家都会根据掷骰子的结果,在棋盘上随机前进若干格。假设我们不再通过掷骰子获得随机性,而是改用一本记录圆周率 π 各位数字的书。比如从小数点后的第 1,012,845 位开始,而这一位恰好是 6。从这里开始,每名玩家接下来就依次使用 π 后面的数字,作为自己每一回合的「掷骰结果」。对玩家而言,甚至对整场游戏的结果而言,随机性究竟来自 π,还是来自每一回合真正掷出的骰子,并没有什么区别。但如果游戏结束以后,我们能够看到所有移动组成的完整序列,并且知道 π 的具体数值,那么就可以判断这场游戏是否很可能是利用 π 来决定移动方式的。从某种意义上说,这场使用 π 的游戏就被「加上了水印」。水印不会改变文本本身的含义,也不会改变读者阅读它时的体验。但如果事后想判断一段文本是否很可能由 Claude 生成,水印就可以帮助完成这种检测。Claude 的文本水印采用了 Google DeepMind 在 2024 年发表于《Nature》论文 中的 SynthID-Text 方法的一个版本。这一系列方法最早可以追溯到 Scott Aaronson 在 2022 年提出的一项方案。它们都遵循前面介绍过的同一个设计原则:水印只改变模型在多个候选词之间进行选择时,所使用的随机性来源。使用我们的密钥,能够回答的只有一个问题:「这段文本有多大可能部分由 Claude 撰写?」即便另一个 AI 同样使用了水印,它也会拥有不同的密钥,而且甚至可能采用完全不同的水印技术。因为短文本中的词语选择次数更少,因此可供判断的信息也更少。随着文本长度增加,我们判断 Claude 是否参与其中的置信度也会提高。因为这类文本可自由选择的词更少,如果强行改变选择,就可能降低事实准确性。例如这句话:「艾萨克·牛顿最著名的著作叫做《自然哲学的数学原理》……」如果已经写到 「Principia」,接下来是不是 「Mathematica」 非常重要,因为这是唯一正确的答案。如果你把一段文章交给 Claude,要求它只修改语法和标点,除此之外什么都不要动,那么水印只能存在于少量被修改的地方。如果 Claude 只是校对或编辑人类写的文本呢?当 Claude 校对一段由人类写成的文本时,它返回的内容通常只会经过轻度编辑。由于其中几乎所有词都来自原作者,水印基本没有多少可以附着的地方,甚至可能完全没有。具体能否检测到 Claude 的参与,要看文本有多长,以及 Claude 对它进行了多大程度的修改。这些改动有时可能不足以让 Claude 的参与被检测出来。Claude 写得越多,它需要做出的词语选择就越多,水印能够存在的空间也就越大。前面提到,AI 水印利用的是这样一些选择:两个不同的词都同样合适,模型可以在它们之间进行选择。如果某个位置要求的是一个精确输出,也就是没有选择余地,换一个词就会导致事实错误,或者让代码无法运行,那么这里不会应用水印。例如,当模型已经写出 「2 + 2 =」 以后,下一个 Token 有一个非常明确的最佳选择。如果模型是在完成这道算术题,就不存在一个和「4」同样正确的答案。出于同样的原因,代码在很多情况下都必须保持精确,因此通常比其他类型的文本包含更少的水印。不过,在代码内部某些确实存在任意选择空间的地方,水印仍然可以发挥作用。但按照定义,这种机制对实际生成代码本身产生的影响将微乎其微。由于它不会生成额外的 Token,因此模型的服务成本和用户使用价格都不会发生变化。无论水印本身还是对应密钥,都不存在可以让任何人还原用户身份、用户所在组织或用户与 Claude 聊天记录的信息。2026 年 7 月,Anthropic 与其他几家主要 AI 模型提供商,以及总计约 190 个签署方,共同签署了欧盟《AI 生成内容透明度行为准则》。该准则要求 AI 系统提供商使用某种方法,对 AI 生成的文本进行「标记」。原因是目前我们还没有一种足够持久、可靠的方式,按不同地区限制水印的使用范围。不过,我们会继续评估不同方案,并在有新进展时公布更新。当 Claude 生成受支持格式的文件时,例如 .png、.jpg 或 .svg,它会在文件的元数据中附加一个内容凭证。它的形式是一小段经过加密签名的信息,用来说明该文件曾由 Claude 创建或处理。相机制造商和图片编辑软件也使用同一套标准,用来记录图片的来源。我们也会提供自己的检测工具,用户可以直接把文件放进去进行检查。文件本身的内容不会发生任何变化,信息也不会嵌入或隐藏在内容之中。和文本水印一样,这个凭证只表示 Claude 曾参与生成或处理这个文件,不包含任何身份识别信息。如果把每一个词都替换掉,完整重写一遍,那么水印就会被去除。当然,在后一种情况下,这段文本是否还能被称为「AI 生成」,本身也存在讨论空间。水印只能判断 Claude 在某个阶段是否很可能参与过这段内容。它无法区分「这段内容是 Claude 写的」和「这段内容被 Claude 大幅编辑过」。由 Claude 生成的翻译会包含水印,因为在这种情况下,每一个词都是由 Claude 选择的。欧盟法律针对 2026 年 8 月 2 日之前发布的 Anthropic 模型设置了一个过渡期。它和 Pangram 这样的 AI 检测软件有什么区别?AI 检测软件使用的是另一套方法,因为提供这些服务的公司并不拥有我们的密钥。除此之外,这些服务还会分析文本中的一些特征,比如 AI 措辞里经常出现的各种细微,或者并不那么细微的「痕迹」。例如,AI 模型似乎非常喜欢使用 「this isn’t [X], it’s [Y]」 这种句式,也就是「这不是 X,而是 Y」。它们使用 「quietly」 这个词的频率,也比你想象中高得多。识别这些语言模式,与检查文本里是否存在水印,从原理上就是两种完全不同的方法。水印会改变某段输出的所有权,或者改变谁需要为它承担法律责任吗?水印只用于帮助判断某段内容是否可能由 Claude 生成或处理过。它不会说明任何有关所有权或作者身份的问题,也不会改变用户根据我们的服务条款所拥有的权利。只有在 Claude 确实参与处理某段内容或某个文件时,我们才会应用水印。 https://www.anthropic.com/news/claude-text-watermark✉️ 邮件标题「姓名+岗位名称」(请随简历附上项目/作品或相关链接)
转载说明:本文系转载内容,版权归原作者及原出处所有。转载目的在于传递更多行业信息,文章观点仅代表原作者本人,与本平台立场无关。若涉及作品版权问题,请原作者或相关权利人及时与本平台联系,我们将在第一时间核实后移除相关内容。