跳到正文

AI工具Hugging Face00:25

构建低延迟多语言语音代理:使用 NVIDIA Magpie TTS 实现开放权重与完全部署控制

Build Low-Latency Multilingual Voice Agents: Open Weights & Full Deployment Control with NVIDIA Magpie TTS

开放权重降部署门槛,但官方未披露延迟具体数值,需自行验证。

判断

自建语音客服或多语言助手的团队,这次可以把 TTS 选型从「买托管 API 省事」改成「用开放权重换可测延迟」——权重和 NIM 容器都跑在自己卡上。代价是压测、容量规划和并发调优的责任从服务商手里接回自己团队。

依据

NVIDIA 的 Maryam Motamedi、Mikyas Desta、Jason Li、Jason Roche 在 Hugging Face 发布 Magpie TTS Multilingual:一个 364M 参数开放权重模型,支持 12 种语言,新增现代标准阿拉伯语、韩语、巴西葡萄牙语。机制上,TTS 是语音链路最后一步,也是用户感知最强的一步,所以关键指标是 TTFA(Time to First Audio,从开始生成到用户听到第一个音的延迟)。官方给出的实测是:单流下 B200 32 ms、H100 47ms、DGX Spark 53 ms、A100 79 ms;64 并发流下 B200 239 ms TTFA、吞吐 319.81× 实时,官方称由此把总端到端压进 sub-200ms 的自然对话窗口。因为跑在自己环境里,这个延迟不含托管服务的往返。材料同时区分了两件东西:开放 checkpoint 用于研究和微调,NIM 是调优后的生产服务栈,二者是同一模型。

  • B20032 ms
  • H10047ms
  • DGX Spark53 ms
  • A10079 ms
同一 Magpie TTS 模型在四种 GPU 单流下的首音频延迟

没写清 材料没有给出任何托管 TTS 服务的 TTFA 对照值,所以不能说开放权重比某家 API 快多少,只能说延迟可自行测量。

下一步 用自家 GPU 按 64 并发跑一遍 NIM,看实测 TTFA 与 RTFX 是否落在官方 B200 的 239 ms 附近。

本期其他新闻

  1. 行业动态

    在ChatGPT中测试广告

    OpenAI

  2. 行业动态

    Daybreak 模型现已在 AWS 上可用

    OpenAI

  3. 行业动态

    构建AI原生财务职能教会了我什么

    OpenAI

  4. AI工具

    推出 Muse Glimmer

    Simon Willison

  5. 精选深读

    考虑 ACE?我们可以用更少的令牌完成

    Hugging Face