跳到正文

精选深读Hugging Face08:00

开放ASR排行榜新增首个南半球语言

The Open ASR Leaderboard Adds Its First Global South Language

南半球语言首进ASR排行,基准覆盖仍偏窄,评测结果需谨慎参考。

判断

选型的人第一次能在 Open ASR Leaderboard 上给 Hindi 排位,但 hi-IN 公开切分只有 1.33 小时、468 位说话人,拿它当采购依据,等于把 468 人的口音当成超过五亿 Hindi 使用者的口音。

依据

Voice Arena 与 Hugging Face 联合发布 Monsoon en-IN 和 Monsoon hi-IN,把 Hindi 放进 Open ASR Leaderboard 的多语言标签页,该页此前只覆盖欧洲语言。文章自述的机制是:排行榜上得分高的模型会被采纳并继续迭代,排行榜不测的能力往往不会改进。团队为让 WER(word error rate,词错率)更难被刷分,已做私有留出切分、基准拟合分析和归一化器补洞;问题在测试集只记录说了什么,几乎不记录是谁说的,按人群分布的差异因此不可见——文中引用的 Racial disparities in automated speech recognition 发现商用系统对黑人说话人的错误率约为白人的两倍。Monsoon 于是给每个片段记录 12 项说话人属性,四个切分互不重叠、合计 4,888 位说话人;Hindi 另附 lattice(可接受拼写变体表),因为其正字法变体不是固定映射,归一化器处理不了。

  • Monsoon hi-IN 公开1.33 h
  • Monsoon hi-IN 私有4.47 h
  • Monsoon en-IN 公开5.62 h
  • Monsoon en-IN 私有5.58 h
四份 Monsoon 切分时长对照,Hindi 公开切分最短。

没写清 材料没有给出任何模型在这两个 Hindi 切分上的 WER,所以不能替它判断 Hindi 识别的实际水平。

下一步 核对 Open ASR Leaderboard 是否公布 Monsoon hi-IN 公开与私有切分的首批模型 WER。

本期其他新闻

  1. 行业动态

    如今,仅凭一个漏洞的传闻就足以发现安全漏洞

    Simon Willison

  2. 行业动态

    支持泰国下一代AI初创企业

    OpenAI

  3. 行业动态

    突破Claude Code Opus 5自动模式

    Simon Willison

  4. 行业动态

    试点全球首个双盲AI评估

    Google DeepMind

  5. 精选深读

    Gemini Omni 1.1 Flash让您以更多控制进行构建

    Google DeepMind