Claude 文本水印的工作原理
摘要
Anthropic 宣布未来 Claude 模型将给生成文本加水印,采用 Google DeepMind 的 SynthID-Text 方案以满足欧盟 AI 法案;水印不改变输出质量、不增加成本,也不携带个人身份信息。
核心要点
- 欧盟自 2026 年 8 月 2 日起要求面向其市场的 AI 提供商标记 AI 生成内容,Anthropic 与多家主要 AI 提供商签署同一行为准则并各自实施水印。
- 该方法基于 Google DeepMind 2024 年发表于《自然》的 SynthID-Text 技术,属于 Scott Aaronson 2022 年提出的方案家族。
- 水印通过改变模型选词时的随机性来源(密钥 + 前文词)来嵌入模式,不添加隐藏字符,也不会让模型选择异常词汇。
- 内部测试显示水印对内容、创造性和可读性无影响;Gemini 上的 A/B 测试未发现统计显著差异,人工对比也未发现质量差别。
- 水印不消耗额外 token、不增加成本,不含可追溯的个人/组织/聊天信息;它只能给出“文本由 Claude 部分撰写的可能性”,不能证明文本是否人类撰写。
原文佐证
- We use a method of watermarking that does not have any practical impact on the quality or content of Claude’s outputs
- As of August 2, the EU requires AI providers serving its market to mark AI-generated content.
- Claude’s text watermark is a version of the SynthID-Text approach published by Google DeepMind in a Nature paper in 2024.
AI 洞察
这标志着 AI 内容溯源正从可选技术变成监管驱动的行业默认配置,Anthropic、Google DeepMind 等主要厂商会相继落地。水印不改变生成质量,却让“某段文字是否由 AI 生成”成为可验证的统计事实,内容平台、学术审查和舆论治理可能据此建立新的信任与问责机制。但水印只能给出概率判断,无法证明人类原创,密钥安全与规避攻防将决定其长期有效性。