AI工具Ahead of AI19:54
从零开始构建 AI 文本检测器
Building an AI Text Detector From Scratch
自己造检测器,比商用更懂局限,但成本高且更新慢。
判断
它把「怎么知道这段文字会不会被判成 AI」这个决定交回写作者自己:与其只信商用接口给出的分,不如本地训一个 0–100 分的分类器,把分数当成润色时的约束条件;代价是这套东西得自己维护,模型一换代就要重训。
依据
Sebastian Raschka(Ahead of AI,2026年8月15日)说,Substack 新上线的 AI 检测功能让他想到把这套过程拆开讲:微调一个 DistilBERT(一种小型文本分类模型)作分类器,输出 0–100 分。他特意声明,这个分数是分类器在自身训练分布下对「AI 生成」这一类的估计概率,不能读成「这段文字真是 AI 写的」的概率。接着他把检测器当 verifier(验证器)接进 RLVR——可验证奖励强化学习,即用能自动判对错的分数当奖励信号——反过来训练小语言模型写出躲过检测的文本。他自己把这事定性为猫鼠游戏:检测器学到某个特征,下一代模型可以不带这个特征,检测器就得重训;他还预告会出现 false positive,也就是把人类写的文字判成 AI。全文只写方法与目标,说方法「类似」Pangram(他推测 Substack 用的就是它),没有给出准确率、误报率或任何成本数字。
- 构建数据集喂训练数据
- 微调 DistilBERT 分类器输出 0–100 分
- 本地部署评分 API 与 UI当验证器
- 接进 RLVR 训练规避模型
没写清 材料没给准确率、误报率和训练/推理开销,所以自建与商用谁更准、谁更贵,这里不能替它补上结论。
下一步 等仓库和本地 UI 放出后,拿一篇 2023 年前自己写的旧文跑一次,看它的 AI 分是不是 0。