跳到正文

精选深读Hugging Face08:00

开放ASR排行榜新增首个全球南方语言

The Open ASR Leaderboard Adds Its First Global South Language

南半球语言首进ASR排行,基准覆盖仍偏窄,评测结果需谨慎参考。

判断

做印度语自动语音识别(ASR)选型的产品负责人,现在得把 Monsoon hi-IN 能否按多拼写参考(lattice)自评,从加分项改成上线门槛;否则按欧洲语言榜单的词错误率(WER)排名选模型,会漏掉 Hindi 正字法变体造成的错误。

依据

Hugging Face 与 VoiceArena 团队(Eric Bezzam、Shobhit Banga 等署名)在文章中说,他们向 Open ASR Leaderboard 加入 Monsoon en-IN 与 Monsoon hi-IN 两个评测集;Hindi 是首个进入这个多语言榜的 Indic 语言,该榜此前只覆盖欧洲语言。机制是榜单决定什么被构建:在 Open ASR Leaderboard 上得分高的模型会被采用和迭代,榜单不测量的能力往往不改进。团队此前用 held-out private splits(留出私有拆分)、benchmark-fitting analysis(基准拟合分析)、normaliser(归一化器)补洞,让 WER(Word Error Rate,词错误率)更难被刷,但它仍只是一个数;测试集记录说了什么,几乎不记录谁说的,种族、性别、年龄和口音差异在榜上不可见。Monsoon 以九个轴变化,四个拆分 speaker-disjoint,共 4,888 名说话人,每人记录 12 个说话人属性;其中 Indian English 公开集 5.62 h、1,444 名说话人,私有集 5.58 h、1,405 名说话人;Hindi 公开集 1.33 h、468 名说话人,私有集 4.47 h、1,571 名说话人。Hindi 集还带 lattice(同一片段可接受的多种拼写列表),因为 Hindi 正字法变体不是固定映射,普通归一化器无法解决。

  • Monsoon en-IN 公开集说话人数1,444
  • Monsoon en-IN 私有集说话人数1,405
  • Monsoon hi-IN 公开集说话人数468
  • Monsoon hi-IN 私有集说话人数1,571
四个 Monsoon 拆分的说话人数对照

没写清 材料没给出 Monsoon en-IN 与 Monsoon hi-IN 上各模型的具体 WER 或排名变化,所以不能替它判断 Hindi 首进榜后谁升谁降。

下一步 下一步可核对 Open ASR Leaderboard 页面是否已把 Monsoon hi-IN 公开拆分列为可自评,并列出对应模型的 WER。

本期其他新闻

  1. 行业动态

    如今,仅凭一个关于bug的传闻就足以发现安全漏洞

    Simon Willison

  2. 行业动态

    关于SpaceX收购Cursor后我们做出的决定

    OpenAI

  3. 行业动态

    支持泰国新一代AI初创企业

    OpenAI

  4. 行业动态

    破解Claude Code Opus 5的自动模式

    Simon Willison

  5. 精选深读

    Gemini Omni 1.1 Flash让您的构建更具控制力

    Google DeepMind