精选深读Hugging Face08:00
衡量语音识别中的基准优化
Measuring benchmark optimization in speech recognition
基准虚高被量化成尺子,选型者得擦亮眼,代价是参考价值打折。
判断
语音识别选型不能只看榜分:模型会复述基准里的错字,公共基准的参考价值要打折。
依据
这项研究用识别错误转写、掩蔽相关词、二义性拼写切换来量基准优化。VoxPopuli里音频明确说了Thank you,参考文本却没写,11个开源模型里有6个复述了错误基准。换到同一说话人的克隆录音或新的议会录音,多数模型的行为反过来了,说明它们在认这是哪条基准,而不是在做转写。
没写清 材料只覆盖了11个模型和两个数据集,清掉基准痕迹之后还会不会这样,没有结论。
下一步 上线前用自己的真实录音复核,不要只按公共榜的名次采购。