跳到正文

AI工具Ahead of AI19:54

从零开始构建 AI 文本检测器

Building an AI Text Detector From Scratch

自己造检测器,比商用更懂局限,但成本高且更新慢。

判断

它把「怎么知道这段文字会不会被判成 AI」这个决定交回写作者自己:与其只信商用接口给出的分,不如本地训一个 0–100 分的分类器,把分数当成润色时的约束条件;代价是这套东西得自己维护,模型一换代就要重训。

依据

Sebastian Raschka(Ahead of AI,2026年8月15日)说,Substack 新上线的 AI 检测功能让他想到把这套过程拆开讲:微调一个 DistilBERT(一种小型文本分类模型)作分类器,输出 0–100 分。他特意声明,这个分数是分类器在自身训练分布下对「AI 生成」这一类的估计概率,不能读成「这段文字真是 AI 写的」的概率。接着他把检测器当 verifier(验证器)接进 RLVR——可验证奖励强化学习,即用能自动判对错的分数当奖励信号——反过来训练小语言模型写出躲过检测的文本。他自己把这事定性为猫鼠游戏:检测器学到某个特征,下一代模型可以不带这个特征,检测器就得重训;他还预告会出现 false positive,也就是把人类写的文字判成 AI。全文只写方法与目标,说方法「类似」Pangram(他推测 Substack 用的就是它),没有给出准确率、误报率或任何成本数字。

  1. 构建数据集
    喂训练数据
  2. 微调 DistilBERT 分类器
    输出 0–100 分
  3. 本地部署评分 API 与 UI
    当验证器
  4. 接进 RLVR 训练规避模型
这个项目从造数据到反过来训练规避检测模型的四步顺序

没写清 材料没给准确率、误报率和训练/推理开销,所以自建与商用谁更准、谁更贵,这里不能替它补上结论。

下一步 等仓库和本地 UI 放出后,拿一篇 2023 年前自己写的旧文跑一次,看它的 AI 分是不是 0。

本期其他新闻

  1. 行业动态

    引用 Dario Amodei

    Simon Willison

  2. AI工具

    CORS Chat

    Simon Willison

  3. 精选深读

    Qwen 3.8 27B 非常出色,但它默认会过度思考

    Simon Willison

  4. 精选深读

    GLM-5.3:中国实验室如何跟上前沿

    Interconnects