精选深读Google DeepMind01:05
推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
Gemini 3.8 Live主打实时交互,扩展思考版更贵,选型得看延迟预算。
判断
做语音 agent 的团队现在要定的是分工而不是二选一:主对话链路挂 Gemini 3.8 Live 保实时,把多步推理甩给 Extended Thinking,还是整条链路都用后者。选错的代价不对称——前者延迟预算超支,后者复杂任务答不动。
依据
Tom Ouyang(Principal Engineer,首席工程师)和 Malini Jaganathan(Member of Technical Staff,技术团队成员)代表 Gemini Audio Team 发布这两个模型。分工写在定位里:3.8 Live「built for scale and cost efficiency」,即冲着规模和单次成本去的,负责实时对话与视觉 grounding(把摄像头或屏幕里的画面当作对话上下文);3.8 Live Extended Thinking 面向高复杂度任务,靠更多推理步数换答案质量。Google 的摘要说两者都能在后台调工具、跑任务而不打断对话,用户今天起可从 Gemini API、Google Workspace、Gemini app 和 Search 拿到。整篇正文没有出现延迟、单价或并发数字。
没写清 Extended Thinking 比 Live 贵多少、后台多步推理会晚多久出声,原文一个数字都没给,延迟预算只能自己测。
下一步 拿同一段多步语音任务在 Gemini API 上分别打 3.8 Live 和 Extended Thinking,记录首次出声延迟与实际账单,再核对 Google 定价页是否更新。