精选深读Hugging Face08:00
开放ASR排行榜新增首个南半球语言
The Open ASR Leaderboard Adds Its First Global South Language
南半球语言首进ASR排行,基准覆盖仍偏窄,评测结果需谨慎参考。
判断
选型的人第一次能在 Open ASR Leaderboard 上给 Hindi 排位,但 hi-IN 公开切分只有 1.33 小时、468 位说话人,拿它当采购依据,等于把 468 人的口音当成超过五亿 Hindi 使用者的口音。
依据
Voice Arena 与 Hugging Face 联合发布 Monsoon en-IN 和 Monsoon hi-IN,把 Hindi 放进 Open ASR Leaderboard 的多语言标签页,该页此前只覆盖欧洲语言。文章自述的机制是:排行榜上得分高的模型会被采纳并继续迭代,排行榜不测的能力往往不会改进。团队为让 WER(word error rate,词错率)更难被刷分,已做私有留出切分、基准拟合分析和归一化器补洞;问题在测试集只记录说了什么,几乎不记录是谁说的,按人群分布的差异因此不可见——文中引用的 Racial disparities in automated speech recognition 发现商用系统对黑人说话人的错误率约为白人的两倍。Monsoon 于是给每个片段记录 12 项说话人属性,四个切分互不重叠、合计 4,888 位说话人;Hindi 另附 lattice(可接受拼写变体表),因为其正字法变体不是固定映射,归一化器处理不了。
- Monsoon hi-IN 公开1.33 h
- Monsoon hi-IN 私有4.47 h
- Monsoon en-IN 公开5.62 h
- Monsoon en-IN 私有5.58 h
没写清 材料没有给出任何模型在这两个 Hindi 切分上的 WER,所以不能替它判断 Hindi 识别的实际水平。
下一步 核对 Open ASR Leaderboard 是否公布 Monsoon hi-IN 公开与私有切分的首批模型 WER。