精选深读Google DeepMind00:20
推出Gemini 3.8 Live与Live Avatar
Introducing Gemini 3.8 Live with Live Avatar
Gemini 3.8 Live主打实时交互,官方更新能否兑现低延迟体验仍需实测。
判断
企业客服与互动导览团队,可以不再按「先等工具返回再开口」设计话术,Live Avatar 把取数挪到对话后台并行。于是采购方的决定点从「用不用」移到「延迟与断流责任怎么写进验收条款」。
依据
Google DeepMind 的 Gemini Audio Team 在 9月24日 的发布中,由 Shuo-yiin Chang(Research Scientist)与 CJ Zheng(Software Engineer)署名介绍 Live Avatar,即给对话式 AI 加上实时视觉形象的特性。机制是把低延迟流式视频与原生实时对话能力耦合:一边处理视觉与音频输入,一边输出带唇形与表情的音视频回应。第二层是异步工具调用(asynchronous tool calling),工具在后台取数时对话不中断,官方举的例子是酒店入住登记。多语言部分是原生语音到语音同步,唇形与表情动态适配,可无缝切换 97 种语言而不降低视频保真度、不引入视觉漂移(visual drift)。今日起在 Gemini Enterprise 可用,而上一周才发布 Gemini 3.8 Live。
- 视听输入同时处理
- 生成语音与视频对话不中断
- 后台工具调用
没写清 材料只写 near real-time,没有给出延迟、帧率或并发上限的任何数字,「低延迟是否兑现」这一块不能替它补。
下一步 在 Gemini Enterprise 里用同一段含语种切换的对话复跑,记录切换发生时唇形是否出现漂移。