跳到正文

精选深读Ahead of AI19:11

Claude 如何为 AI 生成的文本添加水印

How Claude Watermarks AI-Generated Text

水印虽好用,但删除也容易,检测并非万能。

判断

内容审核与取证方与其把 Claude 水印当作出处凭证,不如先定下文本长度和阈值门槛:单段文本命中只能当旁证,未命中也不能反推「不是它生成的」。

依据

Sebastian Raschka 在 8月22日的视频里,把 Anthropic 的文本水印拆到令牌采样(token sampling,即模型每一步从候选词中挑下一个词的环节)这一层:水印不是事后打标,而是在采样时按密钥偏置候选词,所以任何改写、翻译、重打都会稀释信号。他原计划 10 张幻灯片、10 分钟讲完,实际做到 52 张、48 分钟,多出来的部分正是「水印如何失败、如何被移除」。Anthropic 8月14日的官方文章只讲动机、没有一张图,检测与移除的可操作细节因此由第三方补上,也就等于把移除路径和嵌入路径一起公开了。取舍在这里:要压低误报,就得要求更长的未改写原文,可用的检测场景随之收窄。

  • 原计划幻灯片10 张
  • 实际幻灯片52 张
  • 原计划时长10 分钟
  • 实际时长48 分钟
计划 10 张幻灯片、10 分钟,实际 52 张、48 分钟

没写清 材料没说检测在多少词以上才可靠,也没给误报率和漏报率,所以不能断言某段文字一定出自 Claude。

下一步 可核对的下一步:等 Anthropic 公布检测接口的阈值与误报率,或对同一段被改写文本做一次公开复测。

本期其他新闻

  1. 行业动态

    Anthropic 的最佳 AI 模型难以吸引用户,而更便宜的工具蓬勃发展

    Simon Willison

  2. 行业动态

    引用 Drew Breunig

    Simon Willison

  3. AI工具

    你的可执行文件是一个 SQLite 数据库

    Simon Willison

  4. 精选深读

    通过 Kiro 中的 GPT-5.6 提升开发者的性价比

    OpenAI