跳到正文

行业动态Google DeepMind20:59

试点全球首个双盲AI评估

Piloting the world's first double-blind AI evaluations

双盲评估补上人类偏见缺口,但盲法代价是牺牲部分实时监督。

判断

评估的裁决权从「事后翻过程」移到了「事前签盲法协议」:监管方和企业采购现在要决定,是接受一份连评估者本人都无法逐帧复现的分数,还是为可复核性另付一套监督流程的成本。

依据

Google DeepMind 的 William Isaac、Sol Messing、Kristian Lum 在 2026年8月27日 的公告里说,他们联合新加坡 AI Safety Institute、OpenMined、AVERI 与 MLCommons,拿 Gemini Flash Lite 做了他们称为世界首个的、针对专有前沿模型的双盲评估。机制有两条。一是针对 benchmark contamination(基准污染,指模型在训练阶段提前见过考题,从而把分数抬高),把外部评估关进 cryptographically secure environment(密码学安全环境,外部评估只能在加密的盒子内运行,跑出来的东西不能被回收去继续优化模型)。二是把保密题库和外部评估方放进同一套互不知情的盲法安排里。取舍就在这里:题库捂得越严,外部评估者在过程中能看到的中间状态就越少,实时发现题目本身有偏、或运行异常的机会也越小——评估完整性是靠牺牲过程可见性换来的。公告从头到尾没有给出任何可对照的数字,没有污染率,也没有盲法前后的分数对照,所以这份材料能确认的是一次方法试点,不是一次效果验证。付出代价的一方是外部评估者和依赖其过程记录做判断的监管者,收益方是担心分数被污染的企业与实验室。

没写清 材料没交代保密题库由谁保管、外部评估者跑完后能否复核自己的运行记录,所以这套盲法能否被第三方复现,这里不能替它补上。

下一步 看 DeepMind 与新加坡 AI Safety Institute 下一次是否公布 Gemini Flash Lite 在这批保密基准上的具体分数与题目范围。

本期其他新闻

  1. 行业动态

    如今,仅凭一个漏洞的传闻就足以发现安全漏洞

    Simon Willison

  2. 行业动态

    支持泰国下一代AI初创企业

    OpenAI

  3. 行业动态

    突破Claude Code Opus 5自动模式

    Simon Willison

  4. 精选深读

    开放ASR排行榜新增首个南半球语言

    Hugging Face

  5. 精选深读

    Gemini Omni 1.1 Flash让您以更多控制进行构建

    Google DeepMind