AI Detection

Claude 水印:标记存在于何处,以及它能证明什么

Anthropic 于 2026年8月11日开始在 Claude 的文本输出中加标记。此后几乎所有解释都描述错了机制。这个标记不是页面中隐藏的字符,而是模型所选词语上的统计偏差,而这一差别决定了一切, 什么会携带它,什么会清除它,以及阳性结果实际上对文档作者身份能说明多少。

10 min
Diagram contrasting a hidden-character watermark with a sampling watermark carried in the model's word choices

关于 Claude 的水印,自 8 月以来写下的大多数内容,描述的都是一种并非 Anthropic 实际发布的机制。常见说法是,在词语之间藏着一个不可见字符,可能是零宽空格,或者一个外观相似的 Unicode 字形,等待检测器把它找出来。这听起来是合理的猜测,但这是错误的,而且这种错误并非学术性的, 它正是为什么一整类被宣传为水印移除器的免费工具,对这种特定标记完全不起作用。

Anthropic 的标记存在于词语选择本身之中。文本中并没有插入任何内容。一旦这一点明确,实际问题就会以一种在隐藏字符设想仍然成立时无法做到的方式自行得到回答,包括哪些操作会保留该标记,哪些操作会清除它,以及当检测器报告命中时,它实际上在告诉你什么。

以下内容取自 Anthropic 自己的文档,而不是围绕它的报道,并且有意具体说明了公司自身所陈述的限制。

Anthropic's Claude support article on how Claude marks AI-generated content: embedded watermarks in text and signed provenance metadata under the EU AI Act code of practice
Anthropic 自己对标记方案的说明, 嵌入式文本水印加上已签名的来源元数据,新模型按照 EU AI Act 时间表从第一天起就进行标记。

Anthropic 启用了什么,以及何时启用

Anthropic 于 2026 年 8 月 11 日开始对 Claude 的输出进行标记。其关于该主题的帮助中心文章将文本标记描述为“直接嵌入文本本身的不可感知水印”,并表示读者“不会看到它,而且它不会改变含义、质量或可读性”。

覆盖范围很广。于 2 August 2026 当日或之后发布的模型,自发布起就带有标记,Anthropic 将适用对象列为 Claude Platform API、Claude、Claude Code、Claude Cowork 和 Claude Tag,包括通过 AWS、Google Cloud 和 Microsoft Foundry 访问的 Claude。该规则全球适用。把 August 之前起草的任何内容都自动视为豁免并不明智,因为该公司已说明会在过渡期内将更早的模型纳入。

其背后的监管推动来自EU AI Act 第 50 条,其透明度义务要求生成式系统的提供者对机器可读输出作标记。Anthropic 已签署 Article 50(2) 行为准则。值得注意的是,该法规约束的是在 European Union 内使用的系统,并未包含任何会强制全球适用的内容。Anthropic 无论如何都在所有地方应用了该标记,这是一项政策选择,而非法律要求,也正因如此,Kuala Lumpur 或 Chicago 的研究者会受到一项 European 规则的约束。

该标记是一种词语选择模式,而不是隐藏字符

在生成文本的每一步,语言模型都在若干个在其自身统计上几乎等价的后续选项之间作出选择。当一个词和另一个词同样合适时,总得有某种机制打破平局。采样水印依据提供者持有的密钥打破这些平局,因此,在一段合理长度的文本中,累积起来的选择会形成一种模式,而持有同一密钥的检测器可以测量这种模式。

页面中没有添加任何内容。不存在可查找的字符,文本中也没有元数据字段,没有格式化痕迹。你正在阅读的这些词语本身就是水印,具体而言,标记就是从备选项中选出哪些词语的记录。这就是 Anthropic 可以说该标记在意义或可读性上没有成本的原因, 它从来不需要扭曲行文,只需要反复地在两个都可接受的表述之间偏向其中一个。

它也解释了这种持久性。Anthropic 说,这个标记“will travel with the text when it's copied and pasted elsewhere”,其原因是结构性的,而不是巧妙的。复制会保留你的词语。重新排版会保留你的词语。更改字体、导出为 PDF、粘贴到不同的编辑器、转换为纯文本,所有这些都会保留词语的顺序,而词语的顺序正是被测量的对象。

为什么不可见字符清理工具对它没有作用

如今,大量免费工具都把自己宣传为 AI 水印移除器。它们几乎都只做一件事, 扫描零宽 Unicode、不可见空格和形似字形,然后删除找到的内容。这对于一个真实问题来说是一个合理的回应,因为某些系统确实把来源信息嵌入在字符中,而对于从粘贴文本中清除多余格式痕迹来说,这也是正确的工具。

但对于抽样水印,它完全不起作用。把一段 Claude 文本交给字符清理工具,其中每一个不可见字符都会消失,而这段文本的测量结果与之前完全相同,因为没有一个词发生变化。该工具是在一个标记从未存在过的地方寻找它。这是目前流传最具后果性的误解,任何为了这个目的而依赖字符清除器的人,得到的是一种看起来像动作、实际上却不是动作的结果。

这一一般性观点与更广泛的AI 检测器实际上如何工作这一问题并列,不过,带密钥的水印与统计分类器是不同的东西。分类器根据写作的形态进行猜测。水印读取的是一个被故意植入的信号,这使它在识别对象上精确得多,但在告诉你是谁写了这份文档这一点上,并不会更好。

第二种机制,它适用于文件而不是文本

Anthropic 运行两个系统,而相关报道在很大程度上把它们合并成了一个。除了文本水印之外,Claude 生成的文件还可以携带遵循内容来源与真实性联盟(C2PA)开放标准的“签名来源元数据”。

这一半的作用方式与前一种正好相反。C2PA 元数据附着在文件上,而不是贯穿于正文之中,因此相对容易丢失, 只要把文本从文件中复制出来,元数据就会留在原处,因为它从未存在于这些文字之中。两种系统的优势是相反的。文本标记在被移动时仍能保留,并且能够抵抗随意编辑。文件签名则精确且可验证,但无法经受将一段文字选中并粘贴到你自己的文档中的普通操作。

将你自己的论文人性化

改写你的 AI 辅助文本,使其听起来更像人工撰写,同时不改动重要词语或引文。

免费开始

一次正向检测实际上能证明什么

远比“检测”一词所暗示的要少,而 Anthropic 对此表述得异常直接。其文档写道,“检测到 Claude 标记意味着内容可能经过 Claude 处理”,并且“单凭这一点,并不能确认完整的来源”。

请仔细阅读这句话,因为它在精确地发挥作用。是经过处理,不是写作。正向结果与一份由 Claude 从无到有起草的文档相符。它同样也与一份由你自己写成、再请 Claude 帮你润色的文档相符。该信号无法区分这些情况,因为在这两种情况下,Claude 都生成了最终出现在页面上的 token。

其局限性也同样体现在另一个方向。Anthropic 指出,标记可能不会在大量编辑、格式转换或极短段落中保留下来,而且没有标记并不表示内容不是 AI 生成的。因此,负向结果几乎不能证明什么, 文本可能来自另一种模型,来自更早版本的 Claude,或者来自 Claude,但经过了足够多的修改,以致信号被抹去。检测计划通过 Anthropic 自己的界面进行,而不是向第三方开放,因此通用 AI 检测器不会读取这一信号,也不应被期待能够读取。

操作对文本水印的影响原因
复制并粘贴会保留你的文字会被原样保留
重新排版,字体更改,PDF 导出会保留呈现方式会改变,词序不会改变
删除不可见字符没有影响该标记从未存储在某个字符中
轻度复制编辑通常会保留大多数词语会保留下来,因此大多数模式也会保留下来
大幅改写会失效新词语意味着新的选择,与原文不再对应
翻译成另一种语言会失效词元序列是从头重建的
非常短的摘录无论哪种情况都不可靠统计测量需要一段文本才能得出任何结论

这给那些写出自己作品的人带来的归属问题

对这一公告最尖锐的回应,并不是来自任何试图掩饰机器写作的人。它来自律师、研究人员、学者和编辑,他们把该模型当作复制编辑来使用,并注意到了该标记所记录的内容。

考虑一个普通情形。你写了一段文字。论点是你的,证据是你的,结构也是你的。你请 Claude 修正节奏并删去两百个词。返回来的仍是你的段落,只是带上了标记,而这个标记无法说明,在模型看到它之前,几乎所有思考和大部分措辞就已经存在了。如果某个机构、出版商或雇主把阳性结果当作 AI 作者身份的既定证据,这种解读比 Anthropic 自己的措辞所支持的更强,那么作者就只能去反驳一个原本并非为回答所提问题而设计的信号。

这是真正的归属问题,而不是隐匿问题,这一点值得明确说明,因为这两者经常被混为一谈。希望自己的论点归属于自己,并不等同于希望隐藏文档是如何生成的。无论你的机构要求什么披露政策,它仍然要求披露, 清除标记并不会改变你在 AI 使用声明中对读者所负的义务。

什么会清除标记,什么只是看起来会

有一条原则可以涵盖这一切。任何让你的文字保持原样的操作,都会把标记继续带下去。任何重新从头生成这些文字的操作,都会使其失效。其余情况都由此推出。

复制、重新排版、转换文件类型以及去除不可见字符,都会让文字保持原样,因此都会保留标记。翻译和大幅改写会重新生成文字,因此都会使其失效,而 Anthropic 也已承认,重度编辑可能会让标记消失。如果你有时间,手工改写完全可行,只是对整章内容来说,大多数人并没有这样的时间。

这就是我们的免费 Claude 水印移除器所依据的机制。它通过另一个模型逐句重建一段文字,因此每个 token 都会重新生成,而与 Claude 采样相关的信号也就无从附着。开头会变化,分句顺序也会移动,而数字、日期、名称、模糊表达和学科词汇则保持不变,引用材料和参考文献则会逐字复制,而不是改写。最后这一条规则有一个后果,值得提前知道, 从 Claude 中提取的一大段直接引语会保留它到达时所带有的任何标记,因为准确再现引语比这两项义务中的另一项更重要。

对于较长的文档,或者对于学术写作,在这类写作中,语体和引文处理比一般散文更重要,同样的重写方法会贯穿 TextPulse humanizer 的整篇手稿。它是专为研究写作而构建的,并将引文、已定义术语和技术词汇视为固定点。

如果你自己的写作被标记了

首先要准确判断你看到的是什么。一个标记意味着 Claude 在某个时点处理过这段文本。它并不对文档中有多少内容属于你本人作出排序,而如果对话变得正式,Anthropic 自己的表述也会支持你这一点。

保留你已经拥有的任何过程证据。草稿历史、版本文件、笔记和提纲都以一种来源信号无法做到的方式指向作者身份,而且它们比关于统计的论证有说服力得多。如果你的作品必须以你自己的名字发表,而标记造成了真正的归属问题,那么用你自己的措辞重写这段内容就能解决它,无论你是手工完成还是借助工具,因为重写是唯一会触及这类标记的做法。

Anthropic 会继续改变细节。覆盖范围仍在扩展到更早的模型,检测仍在发展之中,而其背后的监管图景也比这项技术更年轻。不太可能改变的是机制,而知道标记存在于用词之中,而不是隐藏字符之中,正是区分一个真正起作用的步骤和一个只是感觉起作用的步骤的关键。如果你想从分类器一侧而不是水印一侧来看同一个问题,那么 向人类读者暴露 AI 写作 的词汇又是另一种信号,而且没有任何密钥能够衡量它。

XLinkedInFacebook

常见问题

它是一种统计标记,Anthropic 将其嵌入 Claude 的文本输出中,自 2026年8月11日起适用于 2026年8月2日或之后发布的每个模型。它不是向页面中插入任何内容,而是依据 Anthropic 持有的密钥,对模型在近似等价词语之间的选择施加偏置,使得足够长的段落呈现出可测量的模式。Anthropic 将其描述为一种不可察觉的水印,直接编织进文本中,不改变含义、质量或可读性。

Mark

Content strategist at TextPulse, here since the company started. Mark writes the product and technical coverage: how the humanizer works under the hood, what changes in each release, and what a specification actually means for your writing. His reviews of writing software come from using them on real documents rather than reading a feature list.

获取 AI 人性化最新动态

获取有关学术写作、AI 检测和人性化的技巧,直接发送到您的收件箱。

不发垃圾邮件。可随时取消订阅。