行业动态Google DeepMind20:59
试点全球首个双盲 AI 评估
Piloting the world's first double-blind AI evaluations
双盲评估补上人类偏见缺口,但盲法代价是牺牲部分实时监督。
判断
这次试点把「模型有没有提前见过题」变成采购方和监管方可以直接写进验收条件的一项,代价是评估结果不能再边跑边同步,只能等隔离环境关盒后一次性披露。
依据
Google DeepMind 的 William Isaac、Sol Messing 和 Kristian Lum 在 2026年8月27日发文,宣布与新加坡 AI 安全研究院(Singapore AI Safety Institute)、OpenMined、AVERI 和 MLCommons 合作,对 Gemini Flash Lite 做首次双盲评估。机制是:外部评估方和机密基准题一起被关进密码学安全环境,模型开发方在开测前拿不到题目,以此挡住 benchmark contamination(基准污染,指评测题在训练阶段已被模型见过,分数因此虚高)。文中用考试作比:考生提前看过题,满分就没有意义。代价落在监督节奏上——题目和作答都锁在盒子里,外部无法在过程中实时复核模型行为,核账被推到关盒之后一次完成。
- 机密基准题封存输入
- 外部评估方在盒内跑测隔离
- 开发方看不到题目输出
- 关盒后披露结果
没写清 材料没有给出这次双盲评估的题量、具体分数或与常规测试的差值,因此无法判断隔离环境把结果改动了多少。
下一步 等 MLCommons 或 DeepMind 公布这次 Gemini Flash Lite 评估所用的基准名称与分数,再核对流程能否被第三方复现。