精选深读Hugging Face05:39
BenchMIRT:LLM基准测试到底在衡量什么?
BenchMIRT: What are LLM benchmarks actually measuring?
基准测试衡量标准存疑,选型需谨慎,避免被榜单误导。
判断
评测和选型负责人不能再把 BBQ、WMDP 等安全基准的总分直接当成安全能力信号;要决定是否为这些榜单做题目(prompt)级拆题,否则会为推理能力买单却误判安全行为。
依据
AllenAI 的 Kyle Wiggers 称,BenchMIRT 在题目(prompt)级审计大型语言模型(LLM)基准,并公开技术报告、数据和代码。它借用心理测量学里的 Item Response Theory(IRT,项目反应理论)——用答题模式估计能力——再扩展成 multidimensional IRT(MIRT,多维项目反应理论),把同一批题上的多种能力拆开。它在 100 个 LLM、16 个基准、超过 34K 道题上训练,未被告知基准标签,却独立恢复出 safety(安全)和 general reasoning(通用推理)两个主导维度,换一次分析仍出现。机制上,BBQ 原测社会偏见、常被归入安全,但这里更贴近 general reasoning;WMDP 测生物、化学、网络安全等危险双重用途知识,也更强关联 general reasoning,且 general reasoning 越强 WMDP 分数越低,因为拒绝或答不出危险知识才算期望回答;HarmBench 的标准与情境题更贴 safety,版权题更贴 general reasoning。把这类题平均成一个分数,会让选型方误把推理难度当成安全表现。
- LLM 数100
- 基准数16
- 问题数超过 34K
- 主导维度2
没写清 材料没给 BBQ、WMDP、HarmBench 各题在两个维度上的载荷值,也没说这些归属会不会随模型版本或题目改写而漂移,因此不能替它补出具体阈值。
下一步 下一步可下载 AllenAI 的 BenchMIRT 数据集,核对 BBQ 与 WMDP 的维度载荷,并复跑同一批 100 个 LLM,看 safety/general reasoning 归属是否复现。