模型生成的句子,读者看起来和普通文字一样;Anthropic 计划让未来的 Claude 模型在生成过程中留下不可见的文本水印,用来判断 Claude 是否可能参与过写作。水印不会添加隐藏字符,也不会携带用户、组织或对话身份信息。1
水印落在模型一次次选下一个词的过程里。面对多个都说得通的词,模型仍然选择合理候选,只是用密钥和前文决定随机性的来源。大量选择累积后,检测器可以计算这段文字与密钥模式的匹配概率。1
这套机制抓住的是低风险选词:事实答案、固定术语和大多数代码没有足够的自由度,水印信号会更稀疏。短文本也缺少可积累的选择;文本越长,检测结果才越有机会变得稳定。1
检测结果的边界同样重要。水印可以支持「Claude 可能参与过」这样的概率判断,却不能证明文字一定由 Claude 独立写成,也不能判断用户是谁、谁拥有内容或谁承担法律责任。轻度校对可能保留部分信号,彻底改写会削弱信号。1
文本水印、AI 检测器和 C2PA 内容凭证属于三种不同证据。文本水印依靠模型密钥,AI 检测器依靠文本特征,C2PA 把签名凭证写进图片或文件元数据。三者回答的问题不同,不能互相替代。1
现在能做的最小实践,是记录模型、时间和原始输出,分别保存轻度编辑、翻译与重写版本;图片和文件保留 C2PA 元数据。Anthropic 表示检测 API 仍在准备,接入前先把证据链保存完整。1
参考:
参考来源
- 1How Claude’s text watermark works
anthropic.com


评论
登录后可发表评论。