精选深读Ahead of AI19:11
Claude 如何为 AI 生成的文本添加水印
How Claude Watermarks AI-Generated Text
水印虽好用,但删除也容易,检测并非万能。
判断
内容审核与取证方与其把 Claude 水印当作出处凭证,不如先定下文本长度和阈值门槛:单段文本命中只能当旁证,未命中也不能反推「不是它生成的」。
依据
Sebastian Raschka 在 8月22日的视频里,把 Anthropic 的文本水印拆到令牌采样(token sampling,即模型每一步从候选词中挑下一个词的环节)这一层:水印不是事后打标,而是在采样时按密钥偏置候选词,所以任何改写、翻译、重打都会稀释信号。他原计划 10 张幻灯片、10 分钟讲完,实际做到 52 张、48 分钟,多出来的部分正是「水印如何失败、如何被移除」。Anthropic 8月14日的官方文章只讲动机、没有一张图,检测与移除的可操作细节因此由第三方补上,也就等于把移除路径和嵌入路径一起公开了。取舍在这里:要压低误报,就得要求更长的未改写原文,可用的检测场景随之收窄。
- 原计划幻灯片10 张
- 实际幻灯片52 张
- 原计划时长10 分钟
- 实际时长48 分钟
没写清 材料没说检测在多少词以上才可靠,也没给误报率和漏报率,所以不能断言某段文字一定出自 Claude。
下一步 可核对的下一步:等 Anthropic 公布检测接口的阈值与误报率,或对同一段被改写文本做一次公开复测。