}


新智元报道


你用Claude写的东西,即将能被全世界查出来!

就在刚刚,Anthropic发了一篇博客,首次公开解释了Claude文本水印的技术细节。

最新一批模型已经全部内置,老模型也在适配的路上。

从此,你的助手就成了Anthropic安插的卧底。


Anthropic这篇官博很长,核心就这几条:


标记怎么藏进去的

这么说吧。

Claude写字是一个词一个词蹦的。每蹦一个词之前,先算出一堆候选词,每个带一个概率。

当好几个词概率差不多的时候,选谁都行。「阴沉的天空」和「灰蒙蒙的天空」意思一样,选哪个纯看随机数怎么掷。

水印动的就是这个随机数。

以前这个随机数没有规律,谁也预测不了。现在Anthropic用密钥算出一串有规律的数把它给替掉了。

最狠的是,Claude不会因此写出别扭的句子,也不会突然蹦出一个你没见过的生僻词。

但拿着密钥的人,可以直接从你的文字里把规律给验出来。


打个比方。

餐厅里红烧肉和糖醋排骨都68块,口味一样好,服务员推荐哪个看心情。

现在餐厅给服务员发了一本暗号本,上一桌点了鱼就推荐红烧肉,点了鸡就推荐糖醋排骨。

一周下来,两道菜卖出去的总量没什么变化。但经理翻一遍点单记录,就知道哪些推荐是按暗号本来的。


这个思路最早是Scott Aaronson 2022年还在OpenAI时提出的。谷歌DeepMind接过去做成了产品级方案SynthID-Text,2024年发在Nature上。

谷歌曾拿自家Gemini做过实测。他们给一部分真实用户悄悄开了水印,然后对比有水印和没水印的用户反馈,结果发现点赞和点踩在统计上并没有显著差异。

值得一提的是,这跟市面上Pangram之类的AI检测工具完全不同。

那些工具没有密钥,只能靠猜文风,猜错是常态。但有了水印之后,就不用猜了,直接拿验密钥就行。


这个卧底比你想的更不靠谱

Anthropic官博里有这么一句:水印只作用于Claude「选择」的词。

想想这意味着什么。

先说翻译。

你写了一篇中文文章让Claude翻成英文。每个英文词都是Claude选的,水印信号拉满。但思想和观点全是你的。


代码也有问题。

大部分位置需要精确输出,水印插不进去。但注释和变量命名有自由度,水印能嵌进去。

至于会不会产生bug,Anthropic说可以忽略不计。

但对工程师来说,「可以忽略」从来不等于「没有」。


短文本好不到哪去。

写个一两百字的邮件回复,可选择的词就那么几个,水印根本留不下什么。

纯事实更是死角。

「牛顿最著名的著作叫做Principia……」后面只能跟Mathematica,没有第二个选项。越是精确表达,水印越没有发挥空间。

到了校对,水印几乎失灵。

你写了三千字的文章丢给Claude改错别字。它改了二十来个地方,整篇文章99%是你写的。那二十个改动里,水印确实留不下多少痕迹。

但问题是,你怎么证明那99%是你自己写的?


硅谷知名科技博主Ben Thompson直接开炮:「我很庆幸自己从来没养成把校对稿直接复制粘贴的习惯。」

而且就算水印测出来了,它也回答不了一个关键问题:这段话是Claude从头写的,还是你写了初稿、Claude帮你大改的?

Anthropic自己承认,水印只能判断Claude「可能参与过」,再细就分不了了。

换句话说就是,用过Claude的人,一律得准备自证清白。


4美分擦掉一切

2026年7月的一项研究发现,这种水印的移除率,高达98.3%。

具体来说,研究者把带水印的文本丢进AI释义工具,让AI换个说法重写一遍。

其中,59篇被检出水印的文本里,跑完之后58篇的水印直接消失。

按当前定价,处理一篇千字文章大约4美分。


而且检测API一旦公开,矛盾还会进一步加深。

因为任何人都能拿它反向优化,改一个词跑一次检测,直到水印信号降到安全线以下。

密码学里管这叫「逃避预言机」。

所以Anthropic的检测API至今「即将推出」,细节「仍在确定中」。

圆珠笔不是作者

不过,就算把这些技术问题全部解决,也依然绕不开一个更根本的问题:

你不会因为用Word写文章,就把Word列为共同作者。

而Anthropic的这种水印,无异于要求一支圆珠笔宣传自己是作者。

一段文字被追溯到Claude,然后呢?

按照Anthropic官方的说法,水印不改变作品所有权,也不改变法律责任归属。


所以现实就是:你的助手留下了记号,但这个记号既证明不了你有罪,也保护不了你清白。

参考资料:

https://www.anthropic.com/news/claude-text-watermark

编辑:摩西