跳到正文

精选深读Google DeepMind00:20

推出Gemini 3.8 Live与Live Avatar

Introducing Gemini 3.8 Live with Live Avatar

Gemini 3.8 Live主打实时交互,官方更新能否兑现低延迟体验仍需实测。

判断

企业客服与互动导览团队,可以不再按「先等工具返回再开口」设计话术,Live Avatar 把取数挪到对话后台并行。于是采购方的决定点从「用不用」移到「延迟与断流责任怎么写进验收条款」。

依据

Google DeepMind 的 Gemini Audio Team 在 9月24日 的发布中,由 Shuo-yiin Chang(Research Scientist)与 CJ Zheng(Software Engineer)署名介绍 Live Avatar,即给对话式 AI 加上实时视觉形象的特性。机制是把低延迟流式视频与原生实时对话能力耦合:一边处理视觉与音频输入,一边输出带唇形与表情的音视频回应。第二层是异步工具调用(asynchronous tool calling),工具在后台取数时对话不中断,官方举的例子是酒店入住登记。多语言部分是原生语音到语音同步,唇形与表情动态适配,可无缝切换 97 种语言而不降低视频保真度、不引入视觉漂移(visual drift)。今日起在 Gemini Enterprise 可用,而上一周才发布 Gemini 3.8 Live。

  1. 视听输入
    同时处理
  2. 生成语音与视频
    对话不中断
  3. 后台工具调用
Live Avatar 在对话中同时处理视听输入并后台取数的链路

没写清 材料只写 near real-time,没有给出延迟、帧率或并发上限的任何数字,「低延迟是否兑现」这一块不能替它补。

下一步 在 Gemini Enterprise 里用同一段含语种切换的对话复跑,记录切换发生时唇形是否出现漂移。

本期其他新闻

  1. 行业动态

    Muse显然将允许你下载其整个文件系统

    The Verge AI

  2. 行业动态

    Muse看起来很像OpenClaw

    The Verge AI

  3. AI工具

    我觉得我找到了一个值得冒险的AI Agent

    Wired AI

  4. AI工具

    使用AgentCore Gateway和MCP构建多账户AI agent

    AWS Machine Learning Blog

  5. AI工具

    Aderant利用Amazon Nova构建智能工单分诊

    AWS Machine Learning Blog

  6. 精选深读

    Google的Gemini现在可以在Pixel手机上为你打电话

    Wired AI