精选深读Hugging Face08:00
开放ASR排行榜新增首个全球南方语言
The Open ASR Leaderboard Adds Its First Global South Language
南半球语言首进ASR排行,基准覆盖仍偏窄,评测结果需谨慎参考。
判断
做印度语自动语音识别(ASR)选型的产品负责人,现在得把 Monsoon hi-IN 能否按多拼写参考(lattice)自评,从加分项改成上线门槛;否则按欧洲语言榜单的词错误率(WER)排名选模型,会漏掉 Hindi 正字法变体造成的错误。
依据
Hugging Face 与 VoiceArena 团队(Eric Bezzam、Shobhit Banga 等署名)在文章中说,他们向 Open ASR Leaderboard 加入 Monsoon en-IN 与 Monsoon hi-IN 两个评测集;Hindi 是首个进入这个多语言榜的 Indic 语言,该榜此前只覆盖欧洲语言。机制是榜单决定什么被构建:在 Open ASR Leaderboard 上得分高的模型会被采用和迭代,榜单不测量的能力往往不改进。团队此前用 held-out private splits(留出私有拆分)、benchmark-fitting analysis(基准拟合分析)、normaliser(归一化器)补洞,让 WER(Word Error Rate,词错误率)更难被刷,但它仍只是一个数;测试集记录说了什么,几乎不记录谁说的,种族、性别、年龄和口音差异在榜上不可见。Monsoon 以九个轴变化,四个拆分 speaker-disjoint,共 4,888 名说话人,每人记录 12 个说话人属性;其中 Indian English 公开集 5.62 h、1,444 名说话人,私有集 5.58 h、1,405 名说话人;Hindi 公开集 1.33 h、468 名说话人,私有集 4.47 h、1,571 名说话人。Hindi 集还带 lattice(同一片段可接受的多种拼写列表),因为 Hindi 正字法变体不是固定映射,普通归一化器无法解决。
- Monsoon en-IN 公开集说话人数1,444
- Monsoon en-IN 私有集说话人数1,405
- Monsoon hi-IN 公开集说话人数468
- Monsoon hi-IN 私有集说话人数1,571
没写清 材料没给出 Monsoon en-IN 与 Monsoon hi-IN 上各模型的具体 WER 或排名变化,所以不能替它判断 Hindi 首进榜后谁升谁降。
下一步 下一步可核对 Open ASR Leaderboard 页面是否已把 Monsoon hi-IN 公开拆分列为可自评,并列出对应模型的 WER。