
Anthropic 近日发布官方博客文章,系统解答了旗下 AI 助手 Claude 文本水印机制的若干基础问题,包括水印的实际工作原理、是否可通过编辑隐藏,以及对代码输出有何影响。
水印如何运作
Anthropic 在博文中介绍,当 Claude 在“低风险选择”场景中生成文本(例如在"overcast"和"grey"两个词之间抉择以描述天气)时,可以在输出中嵌入一种对人眼不可见、但持有解密密钥者可检测的模式。
官方强调,水印不会影响 Claude 的输出质量,"对读者而言,加水印的回复与不加水印的回复毫无区别"。
具体实现上,Anthropic 将采用 Google DeepMind 团队于 2024 年提出的 SynthID-Text 方案,并计划发布水印检测 API。水印机制与市面第三方 AI 检测工具(如 Pangram)的思路不同——后者通过识别写作风格特征(如 his isn't [X], it's [Y] 这类句式)来推断 AI 使用痕迹,Anthropic 明确指出:"识别这类模式与检查水印有本质区别。"
能否通过编辑抹除
Anthropic 表示,轻度编辑"很可能无法完全去除水印",而完全重写(逐词替换)理论上可以消除,但这也意味着"文本是否还能被称为 AI 生成,就值得商榷了"。
至于仅经过 Claude 校对或轻微编辑的文本,水印是否可检测,官方称这取决于"文本长度及 Claude 编辑的深度"。若仅轻度编辑,"绝大多数词汇"仍出自人类之手,"水印几乎没有可依附的内容"。
对代码输出的影响
水印对代码的影响相对较小。Anthropic 解释,模型在生成代码时需保证代码可正常运行,无法像普通文本那样在多种等效选项间自由选择。不过,在代码注释等存在任意词选择空间的区域,水印仍可嵌入,"但对实际生成的代码影响可以忽略不计"。
Anthropic 还指出,Claude 不会是唯一生成带水印文本的 AI 助手,"其他主要模型开发商已签署同一行为准则,也将部署各自的水印系统"。
用户反应与监督&管理背景
此前 Anthropic 宣布将采用水印机制以遵守欧盟《AI 法案》透明度准则(该准则要求 AI 公司使用可识别 AI 生成内容的技术)后,用户社区出现显著分歧。Reddit 上有用户将此解读为"对无辜用户的阴谋",也有人直言:"反对水印的唯一原因就是想对人撒谎。" Business Insider 报道称,X 平台上已有"数十名"用户声称因此取消 Claude 订阅。


评论