跳到正文

行业动态Google DeepMind20:59

试点全球首个双盲 AI 评估

Piloting the world's first double-blind AI evaluations

双盲评估补上人类偏见缺口,但盲法代价是牺牲部分实时监督。

判断

这次试点把「模型有没有提前见过题」变成采购方和监管方可以直接写进验收条件的一项,代价是评估结果不能再边跑边同步,只能等隔离环境关盒后一次性披露。

依据

Google DeepMind 的 William Isaac、Sol Messing 和 Kristian Lum 在 2026年8月27日发文,宣布与新加坡 AI 安全研究院(Singapore AI Safety Institute)、OpenMined、AVERI 和 MLCommons 合作,对 Gemini Flash Lite 做首次双盲评估。机制是:外部评估方和机密基准题一起被关进密码学安全环境,模型开发方在开测前拿不到题目,以此挡住 benchmark contamination(基准污染,指评测题在训练阶段已被模型见过,分数因此虚高)。文中用考试作比:考生提前看过题,满分就没有意义。代价落在监督节奏上——题目和作答都锁在盒子里,外部无法在过程中实时复核模型行为,核账被推到关盒之后一次完成。

  1. 机密基准题封存
    输入
  2. 外部评估方在盒内跑测
    隔离
  3. 开发方看不到题目
    输出
  4. 关盒后披露结果
双盲评估如何把出题、跑测与结果披露三段隔开

没写清 材料没有给出这次双盲评估的题量、具体分数或与常规测试的差值,因此无法判断隔离环境把结果改动了多少。

下一步 等 MLCommons 或 DeepMind 公布这次 Gemini Flash Lite 评估所用的基准名称与分数,再核对流程能否被第三方复现。

本期其他新闻

  1. 行业动态

    突破性发布:Claude Code Opus 5 自动模式

    Simon Willison

  2. 行业动态

    扩大 OpenAI 在巴西的业务版图

    OpenAI

  3. 精选深读

    Gemini Omni 1.1 Flash 助您更精细地构建应用

    Google DeepMind

  4. 精选深读

    Qwen3.8-Flash-Next

    Simon Willison

  5. 精选深读

    更佳答案,更广思维:学生从 ChatGPT 与批判性思维训练中的收获

    OpenAI