跳到正文

精选深读Hugging Face05:39

BenchMIRT:LLM基准测试到底在衡量什么?

BenchMIRT: What are LLM benchmarks actually measuring?

基准测试衡量标准存疑,选型需谨慎,避免被榜单误导。

判断

评测和选型负责人不能再把 BBQ、WMDP 等安全基准的总分直接当成安全能力信号;要决定是否为这些榜单做题目(prompt)级拆题,否则会为推理能力买单却误判安全行为。

依据

AllenAI 的 Kyle Wiggers 称,BenchMIRT 在题目(prompt)级审计大型语言模型(LLM)基准,并公开技术报告、数据和代码。它借用心理测量学里的 Item Response Theory(IRT,项目反应理论)——用答题模式估计能力——再扩展成 multidimensional IRT(MIRT,多维项目反应理论),把同一批题上的多种能力拆开。它在 100 个 LLM、16 个基准、超过 34K 道题上训练,未被告知基准标签,却独立恢复出 safety(安全)和 general reasoning(通用推理)两个主导维度,换一次分析仍出现。机制上,BBQ 原测社会偏见、常被归入安全,但这里更贴近 general reasoning;WMDP 测生物、化学、网络安全等危险双重用途知识,也更强关联 general reasoning,且 general reasoning 越强 WMDP 分数越低,因为拒绝或答不出危险知识才算期望回答;HarmBench 的标准与情境题更贴 safety,版权题更贴 general reasoning。把这类题平均成一个分数,会让选型方误把推理难度当成安全表现。

  • LLM 数100
  • 基准数16
  • 问题数超过 34K
  • 主导维度2
BenchMIRT 审计规模:100 个 LLM、16 个基准、超过 34K 道题,并恢复出 2 个主导维度。

没写清 材料没给 BBQ、WMDP、HarmBench 各题在两个维度上的载荷值,也没说这些归属会不会随模型版本或题目改写而漂移,因此不能替它补出具体阈值。

下一步 下一步可下载 AllenAI 的 BenchMIRT 数据集,核对 BBQ 与 WMDP 的维度载荷,并复跑同一批 100 个 LLM,看 safety/general reasoning 归属是否复现。

本期其他新闻

  1. 行业动态

    Claude的新系统提示词确实不想重现歌曲歌词

    Simon Willison

  2. 行业动态

    引用Tarn Adams

    Simon Willison

  3. 行业动态

    AI原生公司如何将工作流转化为运营能力

    OpenAI

  4. AI工具

    ATV Big Air Tour借助ChatGPT将3天工作缩短为3小时

    OpenAI

  5. 精选深读

    在Confluent上利用IBM时间序列模型实现实时智能

    Hugging Face

  6. 精选深读

    推出基于Gemini的智能体视频理解

    Google DeepMind