Claude 的文字水印:看不见,如何被检测?

Claude 的文字水印:看不见,如何被检测?

解释 Anthropic 如何把 Claude 的文字水印藏进生成时的随机选择,以及它在归属、编辑和欧盟透明度规则下的证据边界。

0:00 / 5:23

节目导览

8 月 14 日,Anthropic 发布文章解释 Claude 的文字水印。它不是在文本里添加隐藏字符,而是利用生成过程中许多低风险的词语选择,留下读者看不出的统计模式。掌握对应密钥的检测器,可以据此估计 Claude 是否参与过写作或编辑。1
本期把这个机制和常见的 AI 文本检测器区分开,也解释它为什么对短文本、事实答案、代码和轻度编辑的判断力不同。Anthropic 采用的方法属于生成式水印:它改的是采样过程,而不是训练数据、模型参数,或已经写完的文章。2

水印藏在哪里

语言模型每次生成下一个词时,都会在一组候选中做选择。有些候选都足够合理,最终选谁主要由随机性决定。Anthropic 的说法是,用密钥和前面几个词来决定随机性的来源,于是单个词仍然自然,整段文字却可能累积出可检测的模式。它不增加字符,不额外生成 token,也不把用户、组织或对话信息写进水印。1
这条技术路线可以追溯到 2023 年 Kirchenbauer 等人的论文。论文提出在生成前随机划出一组「绿色」候选词,再轻微提高它们被选中的机会,并用统计检验计算水印证据。Claude 采用的不是这篇论文的原样实现,而是 Anthropic 所称的 SynthID-Text 方法版本。3

它能证明什么

水印给出的不是「这一定由人工写成」或「这一定由 Claude 独立完成」这样的结论。它最多说明 Claude 很可能在某个阶段参与了生成或处理,也不能据此判断内容真假、作者、版权或法律责任。文本越短,可供统计的选择越少,判断就越弱;事实答案只有一个时没有多少水印空间,代码也通常比散文留下更少信号。只做语法校对时,改动太少,同样可能检测不出来。翻译则因为每个词都由 Claude 重新选择,更容易留下信号。1
这也解释了它和常见 AI 检测器的差别。后者通常从措辞、句法或训练出来的风格特征反推文本来源,不掌握 Claude 的密钥,且可能受到领域变化和误报影响。水印是在生成时留下的规则信号,验证对象更具体,但前提是检测方拥有正确的密钥和足够长的文本。关于水印在改写、释义和手写内容混合后的可靠性,相关研究显示信号会被稀释,不能把任意一项实验直接当成 Claude 产品的保证。24

为什么现在上线

欧盟人工智能法第五十条第二款要求,生成合成文本的系统把输出做成机器可读,并且能被检测为人工生成或操纵;相关标记义务从 2026 年 8 月 2 日起适用。对面向公众利益的信息文本,法律保留了一个条件式例外:经过人工审核和编辑控制,且没有实质改变内容。5
欧盟委员会在 7 月 31 日称,约 190 个组织签署了生成式人工智能透明度实践准则,名单中包括 Anthropic、Google、Meta、Microsoft 和 OpenAI。Anthropic 选择全球推出,是因为目前还没有足够持久的地区范围控制方案。对于 PNG、JPG、SVG 等文件,Anthropic 说会使用 C2PA 内容凭证;那是写入文件元数据、带数字签名且可验证篡改的来源记录,不等同于文字水印的统计信号。67

听完要记住

这次更新不是给 Claude 的文字贴上可见标签,也不是一种能自动判定「谁写的、内容真不真」的证据。更准确的理解是:Anthropic 把生成时原本无关紧要的随机选择,变成了一种带密钥的来源线索。它有望帮助平台和机构在事后复核,但仍受文本长度、内容确定性、编辑方式和检测器开放程度限制。Anthropic 表示会提供水印检测接口,具体实现仍在确定。1

This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.

Related content

More from this channel