精选深读Ahead of AI19:11
Claude 如何为 AI 生成的文本添加水印
How Claude Watermarks AI-Generated Text
水印虽好用,但删除也容易,检测并非万能。
判断
Anthropic 给 Claude 文本输出加水印后,要改的是审核方和内容平台的取证流程:不能把检测结果当成作者归属的唯一证据;一旦水印可被改写或删除,就得转为抽样复核,并接受漏判与误判的成本。
依据
Sebastian Raschka 在 8月22日发布 48 分钟视频(原本计划 10 页幻灯片、10 分钟,最终超 50 页)解释 Claude 水印:Anthropic 在 8月14日文章只讲为何做、没讲怎么做,他补的是 token sampling(模型逐词元采样)阶段如何被用来嵌入水印,以及检测和删除如何让信号失效。水印检测因此只能提供概率线索,不能单独证明某段文字出自 Claude;审核方若把它当唯一证据,错判成本会落到被指控的作者身上。
- 原计划幻灯片10 页
- 最终幻灯片>50 页
- 原计划时长10 分钟
- 最终时长48 分钟
没写清 材料没给检测的误报率、漏报率,也没说删除后还剩多少可检测信号。
下一步 可核对 Raschka 随视频发布的幻灯片是否列出检测阈值,或删除实验的具体结果。