精选深读Hugging Face08:00
衡量语音识别中的基准优化
Measuring benchmark optimization in speech recognition
基准虚高被量化成尺子,选型者得擦亮眼,代价是参考价值打折。
判断
语音选型的人该把 ASR 榜单分数从采购依据降成初筛门槛:让候选模型在自己录的干净音频上复跑一遍再签。因为音频里只要带上基准的那点声学痕迹,分数就会替模型说出它没听到的话。
依据
Hugging Face 与 HumeAI 的 Theo Lebryk 等人在 8月21日发文,用三个测试量化语音识别里的基准优化(benchmark optimization,指模型记住测试集而非学会任务的提分方式)。共识分歧探针(consensus disagreement probe)让一组按音素错误率 PER(phoneme error rate,转写与音频发音的吻合度)挑出的独立模型做集成,凡是集成一致否定基准参考转写的片段就送人工标注。一段 VoxPopuli 音频里说得出 “Thank you, Mr. President”,参考转写却漏掉 “Thank you”,11 款模型中有 Six of the 11 照抄了这条错误转写,连漏掉该短语的模型也一并复制基准把 Mr 写成不加句点的标点风格。换成新录的议会克隆音或通用音色后,多数模型又改回照音频转写,说明它们响应的是「这是哪套基准」的声学线索。VoxPopuli 参考转写本身错误多,Artificial Analysis 才出过清洗版。
- 受测开源 ASR 模型11 款
- 复现基准错误转写的模型Six of the 11
没写清 材料没给出这 11 款模型在抹掉基准声学线索后的重排名,也没说复现错误转写的那些系统分数会掉多少。
下一步 在 Hugging Face 的 Open-ASR Leaderboard 上核对该文所说的 held-out 集是否已挂出这 11 款模型的复测分数,看谁掉出前段。