
Claude 文本水印的证据边界:能判断模型参与,不能判断作者身份
Anthropic 宣布未来 Claude 模型将采用基于 SynthID-Text 的文本水印;真正需要理解的是它如何利用生成时的随机选择留下统计信号,以及短文本、事实密集文本和改写会怎样削弱这份证据。
Anthropic 于 2026 年 8 月 14 日解释,未来 Claude 模型会在生成文本时加入水印。它公布的重点不是一个可供外部复现的完整检测器,而是这套机制的证据边界:水印不向文字添加字符,不增加输出 token,也不携带用户、组织或对话信息;检测结果只回答「Claude 是否可能参与过这段文本的生成或处理」。1
这项变化最值得理解的地方,在于它没有另造一套「AI 文风」。它改的是模型每一步选择下一个 token 时所使用的随机性。
水印改的是抽样规则
Claude 这类语言模型会根据已有上下文,为下一个 token 计算一组概率,再从中抽样。句子「今天的天气很冷,而且……」后面接「阴沉」或「灰暗」,通常都不会改变句子的主要意思。水印利用的正是这类低风险选择:它不把某个词永久标成「应该选」,而是让选择过程使用与水印密钥和近期上下文相关的伪随机种子。1
SynthID-Text 论文把这个过程拆成三步:随机种子生成器、采样算法和评分函数。生成器根据近期 token 和密钥产生种子;采样算法从模型原本给出的候选分布中取出多个候选,经过多层 Tournament sampling 逐轮比较,留下一个最终 token;检测器再用同一把密钥,检查整段文本里的 token 是否呈现出预期的统计相关性。2
这意味着水印不是一张固定的「绿色词表」。同一个词在不同上下文中可能赢,也可能输;检测器要看的不是某个词出现过没有,而是很多次选择叠加后是否形成了不太可能由普通抽样产生的模式。Nature 论文的实验通常使用最近 4 个 token 参与生成种子,并使用 30 层 Tournament sampling;这些是论文披露的实验配置,Anthropic 没有说 Claude 采用完全相同的参数。2

「不影响质量」需要准确理解
Anthropic 表示,内部测试没有发现水印影响 Claude 文本的内容、创造性或可读性。它引用的 SynthID-Text 论文也提供了较大规模的质量实验:研究者把约 2000 万条 Gemini 生产回答随机分到有水印和无水印版本,两个版本的点赞率相差 0.01 个百分点,点踩率相差 0.02 个百分点,差异均未达到统计显著;在 3000 个 ELI5 问题的人工对比中,语法连贯性、相关性、正确性、帮助性和总体质量也没有显著偏好差异。12
这组证据支持一个较窄的结论:在论文所测试的非失真配置和任务范围里,水印没有造成可测的质量下降。它不等于每次抽样都与无水印版本完全相同。论文明确讨论了取舍:更强的水印可以提高可检测性,但可能损失质量;面向质量保持的配置虽然不改变单次回答的总体质量,仍可能减少不同回答之间的多样性。2
论文还报告了很小的推理开销。在 Gemma 7B-IT、30 层 Tournament sampling 的实验中,每 token 延迟从 15.527 毫秒增至 15.615 毫秒,增幅为 0.57%。Anthropic 则表示,水印不需要额外 token,因此不会单独增加 Claude 的 token 服务价格;这两句话分别对应计算延迟和计费 token,不能混成「完全没有任何系统开销」。12
检测信号会在哪些文本上变弱
水印能利用的不是所有 token,而是模型在多个候选之间有选择余地的那些位置。文本越长,累积的统计证据通常越多;模型分布的熵越高,候选越丰富,采样算法越有空间留下信号。相反,如果模型几乎总会选同一个 token,或者事实、公式和代码要求唯一答案,水印能改变的地方就少。Nature 论文也把文本长度和生成分布熵列为影响检测性能的主要因素。2
这解释了 Anthropic 给出的几个例子。句子已经确定「2 + 2 = 4」时,换成别的 token 会直接出错;严格代码也经常要求精确的符号和标识符,所以这类内容的水印通常比自由文本稀疏。只让 Claude 修改人类原文的语法和标点时,大部分词仍然来自人类,水印只能附着在少数改动上,短文本可能不足以形成可靠判断。反过来,翻译任务里的每个词都由 Claude 重新选择,留下统计信号的机会会更多。1
所以,水印检测更接近带阈值的概率判断,而不是逐篇文本盖章。Anthropic 说将提供检测 API,但截至这篇博客发布时,API 的实现细节、阈值、最低样本长度和误报表现都还没有公开。短句检测、只看几个关键词,或者把「未检测到」直接解释成「没有使用 Claude」,都超出了现有证据能支持的范围。1
它证明的是模型参与,不是作者身份
Anthropic 对水印能证明什么的表述很克制:它可以帮助判断 Claude 是否可能在某个阶段参与了文本,但不能证明 Claude 独立写成了全部内容,也不能证明文本一定不是人类写的。Claude 重写整段文字、替换掉每个词,通常可以去掉原有水印;轻度编辑可能只会削弱信号,最终是否还能检出取决于剩余的模型生成内容和文本长度。1
它也不能把结果指向某个用户。水印密钥用于判断生成过程是否符合某种模式,不编码用户姓名、组织、聊天记录或其他身份信息。它同样无法识别没有使用同一方案的其他模型;一个文本没有 Claude 水印,最多说明当前检测没有找到 Claude 这套信号,不能据此排除其他 AI 或人工参与。1
这与常见的后置 AI 检测器是两种不同的证据来源。生成式水印需要模型服务方在生成时掌握密钥并主动埋入信号;后置检测器则从成文后的语言统计特征推断来源,不要求各家模型事先合作。Nature 论文把两者视为互补:水印对主动采用它的服务更有针对性,后置检测器能覆盖未加水印的来源,却会面对跨领域、跨语言、模型更新和误报问题。2
合规改变了部署动机
Anthropic 说,推动这项变化的直接原因是遵守 EU AI Act。欧盟委员会 2026 年 7 月 31 日的官方页面称,约 190 家机构已经签署 AI 生成内容透明度 Code of Practice,相关标记义务于 2026 年 8 月 2 日开始生效;Anthropic 是签署方之一。3
Anthropic 选择全球上线,是因为目前还没有足够持久的办法只按地区开启水印。这个背景解释了为什么水印会被放进生成服务的默认链路,但它不替技术本身增加检测准确率。是否符合监管要求、是否能在一段短文本上可靠判断 Claude 参与过,是两个不同问题。1
读者和团队该怎样使用这个信号
做内容归因时,先保留原文和上下文。 更准确的说法是「检测结果支持 Claude 可能参与过」,而不是「这一定是 Claude 写的」。如果原文经过人工改写、翻译、拼接或代码格式化,评估时还要记录这些变化,因为它们会改变可检测证据的数量。
做产品评测时,把水印当作生成链路的一项属性。 团队需要按文本长度、语言、温度、事实密度、代码比例和改写强度分别测试,而不是拿一段长的自由文本结果推断所有场景。Anthropic 尚未公开 Claude 版本的检测器和参数,外部团队暂时无法仅凭这篇博客复算它的误报与漏报边界。1
做审核决策时,不要把单一检测结果当成作者认定。 水印回答的是生成服务是否可能参与过;版权、责任、署名和是否存在人工编辑,仍需要来源记录、版本历史和具体工作流来判断。Anthropic 也明确说,水印不会改变输出的所有权或用户在服务条款下的权利。1
References
- 1How Claude’s text watermark works
anthropic.com
- 2
- 3Strong backing for the Code of Practice on Transparency of AI-generated Content
digital-strategy.ec.europa.eu
This story was produced automatically by a channel. One sentence is all it takes for Neodrop to keep producing for you.
Related content
- Sign in to comment.
