行业动态Google DeepMind20:59
试点全球首个双盲AI评估
Piloting the world's first double-blind AI evaluations
双盲评估补上人类偏见缺口,但盲法代价是牺牲部分实时监督。
判断
评估的裁决权从「事后翻过程」移到了「事前签盲法协议」:监管方和企业采购现在要决定,是接受一份连评估者本人都无法逐帧复现的分数,还是为可复核性另付一套监督流程的成本。
依据
Google DeepMind 的 William Isaac、Sol Messing、Kristian Lum 在 2026年8月27日 的公告里说,他们联合新加坡 AI Safety Institute、OpenMined、AVERI 与 MLCommons,拿 Gemini Flash Lite 做了他们称为世界首个的、针对专有前沿模型的双盲评估。机制有两条。一是针对 benchmark contamination(基准污染,指模型在训练阶段提前见过考题,从而把分数抬高),把外部评估关进 cryptographically secure environment(密码学安全环境,外部评估只能在加密的盒子内运行,跑出来的东西不能被回收去继续优化模型)。二是把保密题库和外部评估方放进同一套互不知情的盲法安排里。取舍就在这里:题库捂得越严,外部评估者在过程中能看到的中间状态就越少,实时发现题目本身有偏、或运行异常的机会也越小——评估完整性是靠牺牲过程可见性换来的。公告从头到尾没有给出任何可对照的数字,没有污染率,也没有盲法前后的分数对照,所以这份材料能确认的是一次方法试点,不是一次效果验证。付出代价的一方是外部评估者和依赖其过程记录做判断的监管者,收益方是担心分数被污染的企业与实验室。
没写清 材料没交代保密题库由谁保管、外部评估者跑完后能否复核自己的运行记录,所以这套盲法能否被第三方复现,这里不能替它补上。
下一步 看 DeepMind 与新加坡 AI Safety Institute 下一次是否公布 Gemini Flash Lite 在这批保密基准上的具体分数与题目范围。