}

出品 | 网易智能

作者 | 辰辰

编辑 | 王凤枝

Anthropic又出"骚操作",这次不少Claude用户坐不住了。

最近,Anthropic更新了一篇支持文档,标题很平:How Claude marks AI-generated content(Claude如何标记AI生成内容)。

但正文说的事不小。


一是,从2026年8月2日起,在欧盟推出的新Claude模型,发布时就会支持机器可读标记;此前已经上线的模型,则处于后续适配和过渡阶段。

二是,Claude会采用两种标记方式:生成文本嵌入不可见水印;对于受支持的文件类型,附加符合C2PA标准的数字签名来源元数据。

Anthropic表示,受支持模型的标记会覆盖Claude网页版、API、Claude Code、Claude Cowork、Claude Tag,以及AWS、Google Cloud等合作平台,全球范围内都会生效。不过,不同平台和功能可能不支持全部标记类型。

对用户来说,问题也就来了:

一篇文章是人写的,只是丢给Claude润色、翻译或校对,它返回的版本,会不会也带上AI处理痕迹?

争议就出在这里。

有网友举了个例子:你花了半年写的书稿,丢进去校对一遍语法,Claude返回的完整校订稿,也可能带上一枚"AI水印"。

这枚水印能说明的,只是文本可能经过Claude处理;它不能证明Claude是原作者,更不能证明整篇文章由AI创作。

一、水印标记Claude输出,却不说明人和AI各写了多少

这场争议的核心不在技术本身,而在一个更现实的问题:水印说明不了,一份输出里有多少内容原本出自用户,Claude又改了多少。

严格来说,水印不会反向写进用户保存在本地的原稿。它标记的是Claude返回的输出。

如果Claude只列出几处修改建议,用户手动改回原稿,本地文件不会被整体替换成Claude输出;至于少量采用这些建议后,最终文本是否还会留下可检测信号,Anthropic目前没有公布技术细节。

但如果用户让Claude重新输出一版完整校订稿,再直接复制这份返回内容,那么按照Anthropic的说明,这个版本就可能带上水印,哪怕其中绝大部分文字原本出自用户。

广播节目主持人埃里克·埃里克森(Erick Erickson)的帖子被大量转发。他是这么说的:

之前觉得Grammarly不好用,换Claude来校对语法。现在,自己写的文章经过Claude校对后,返回版本也可能带上水印,显示这份内容经过Claude处理。


他的措词很直接:荒谬至极。

这不是一个人在抱怨。

Reddit上,有人发起了更激烈的讨论:AI生成的内容,到底应该归功于谁,机器,还是给机器下指令的人?

发帖者说:"我给了指令、背景、决策、无数轮修改,Claude只是工具。"

反对者的回答更尖锐:"Claude完成了工作,你只是给了指令。如果你的上司给你布置任务,你做完了,他拿走100%的功劳,你会怎么想?"

二、普通用户可能保留水印,刻意规避者仍可能绕过

开发者群体的反应更激烈。

软件工程师尼克·多博斯(Nick Dobos)直接开火:"Claude居然在我的代码库里添加隐形水印???简直胡扯!这会开一个极其恶劣的先例!我们到底在干什么?"

X用户@0xSweep发了一条被大量引用的长帖,核心是三层逻辑:

第一层,普通用户可能被标记。"你花了六个月写书,然后贴到Claude里修语法,返回版本就可能带着水印。你的原创作品,现在带上了AI处理标记。"

第二层,真正想隐藏AI使用痕迹的人可能尝试绕过。"把文字翻译成法语再翻译回来,水印可能就没了。"

第三层,检测工具还没发布。"能读这个水印的工具,到现在还没有公开。"

三条放在一起,他把争议概括为:诚实用户可能保留水印,真正想规避检测的人反而可能通过翻译、重写等方式削弱信号。

他的结论是:

这是公司在保护自己,却把它说成是在保护用户。

也有人提到了企业和API用户最关心的问题:"官方文档没有写明退出选项。受支持模型的标记不只影响聊天界面,API和企业使用场景也在覆盖范围内。"

活跃开发者格雷戈里·维伯(Gregory Wieber)补充了另一个角度:"不做任何区分。校对语法和从零生成,打的是同一种标记。这会坑到很多人。"

三、云端的AI听他们的

专业创作者的反应两极分化。

职业创意人瑞安·拉利(Ryan Lally)站在支持一方。他觉得,"AI帮你做研究、头脑风暴、梳理思路,没问题。但最终面向客户的作品,应该是100%你自己的。"

也有用户的立场更鲜明:"恨AI,这第一步走得好。"

支持水印的人觉得,来源信号能让AI内容更透明;反对的人担心,同一种标记看不出"AI辅助""AI改写"和"AI全篇生成"之间的差别。

争议最后集中到了同一个问题:水印可以提供文本可能经过Claude处理的信号,却不能告诉检测者,Claude在这份内容里究竟扮演了什么角色。

还有一些反应不那么愤怒,但想得更远。

一名网友的长贴开头是"这会加速本地AI的普及"。

他从水印里读出了更长的逻辑链:如果每一段文字都能追溯来源,下一步,是不是追溯到人?

最后一句像一盆冷水:"云端的AI听他们的。"

四、OpenAI两年前就研究过,但没有发布

在这整件事里,有一个绕不过去的参照物:OpenAI。

据《华尔街日报》此前报道,OpenAI至少两年前就研究过文本水印系统。在特定内部测试中,相关检测器识别ChatGPT生成文本的准确率曾达到99.9%。

但他们最终没有发布。据报道,内部调查还发现,接近30%的受访用户表示,如果水印上线,可能会减少使用ChatGPT。

商业顾虑是没有发布的原因之一。除此之外,OpenAI内部还讨论过误报、水印被绕过,以及检测结果可能被错误使用等问题。

Anthropic这次却发布了。

这次部署有明确的欧盟合规背景。

需要区分的是,Anthropic签署的《AI生成内容透明度行为准则》本身属于自愿安排;真正有法律约束力的,是2026年8月2日起适用的《欧盟人工智能法》第50条透明度义务。

违反相关法定义务,最高可能面临1500万欧元或全球年营业额3%的罚款。罚款针对的是违反法定义务,不是拒绝签署行为准则。

据公开报道,截至7月底,已有近200家公司签署相关行为准则,Meta、微软、OpenAI、Synthesia都在名单上。

欧盟的法律义务主要针对其适用场景,但Anthropic选择把受支持模型的标记扩展到全球。

至于为什么全球统一部署,Anthropic没有解释。

@0xSweep提出了一种推测:同时维护带水印和不带水印的两套模型,成本可能高于统一标记。

但这也只是外界猜测。

五、文本水印会不会影响文字质量?

技术层面的疑问,来自GPTZero首席技术官亚历克斯·崔(Alex Cui)。

Anthropic还没有公开Claude文本水印的具体技术方案。崔在一篇技术解释里,用KGW等常见方案说明前沿模型可能如何嵌入水印。

以他介绍的简化版KGW方法为例:模型生成每个词时,会用密钥把候选词分成"绿组"和"红组",然后提高选择绿组词语的概率。

检测时,系统根据密钥和上下文重新计算词语所属分组。如果一段文字里来自绿组的词语比例明显偏高,就可能判断其中存在水印信号。

崔认为,许多能快速运行并支持流式输出的文本水印方案,会轻微改变模型选择词语的概率分布。按照他转述的Google研究,一项覆盖两万条文本的人类反馈实验显示,多数人没有察觉这种变化。

Anthropic则在官方文档里表示,其嵌入式水印不会改变Claude回答的含义、质量和可读性。

由于Anthropic还没有公布具体实现方式和独立测试结果,目前无法确认Claude水印是否会造成质量变化,以及变化究竟有多大。

崔对水印稳健性的判断并不乐观。

在他自己的测试中,一些免费的重写工具已经可以绕过Google DeepMind的SynthID。要注意的是,这项测试针对的是Google的方案,不是尚未公开技术细节的Claude水印。

这些局限带来了另一种担忧:水印的实际效果可能并不对称。大量编辑、改写、翻译、与其他内容混合,或者文本过短,都可能让水印无法被可靠检测。

崔的判断是:如果Anthropic公开发布检测器,人们可能通过反复测试找到稳定的移除方法;如果检测器只向政府或特定机构开放,攻击难度会更高,但已有研究显示,不依赖检测器的零样本攻击同样可能破坏部分水印。

在崔看来,这类方案更像一套"足够可用"的合规机制,而不是无法绕过的防作弊系统。

六、给输出打水印,训练数据的水印呢?

回到那篇支持文档。

Anthropic自己写了很长一段"局限性":

检测到水印,只能说明这段文字可能经过Claude处理。不能证明Claude是原作者,也不能证明Claude是唯一作者。

文字可能在标记后被修改、摘录或混入其他内容。没有检测到水印,也不等于这段文字没有经过AI生成或处理。

换句话说,这枚水印提供的是一条来源信号,而不是对作者身份的完整证明。

它能说明的范围很有限:内容可能经过Claude处理,但看不出处理发生在校对、翻译、摘要、改写还是从零生成阶段。

Anthropic也承认,水印的检测效果可能不对称。

普通用户通常不会主动破坏水印,而真正想隐藏AI使用痕迹的人,反而可能通过大量改写、翻译、混入其他文本,或者改用不采用同类标记的模型,把检测信号磨掉。

也就是说:对不主动规避的人,水印更可能被保留下来;对刻意规避的人,它却不一定是稳定的障碍。

@syedOsama001的评论,把这种反差概括得最狠:"给输出打水印,那训练数据的水印呢?"

这不是对文本水印有效性的直接技术反驳,而是在质疑AI行业对输出和训练数据采用的透明度标准是否对称。

水印已经进入Claude的新模型。但谁能检测、准确率如何、出现误判后怎么办,Anthropic还没有给出公开答案。