AI工具Simon Willison06:47
Gemini Live 音频
Gemini Live audio
Gemini Live 强化音频,但适用场景仍限实时语音互动
判断
要接语音代理的团队,可以把服务端音频中转这一步从排期里删掉,直接在浏览器里连 Gemini 3.8 Live;但它只吃实时语音这一段,与 OpenAI 的 GPT-Live 是同一形态,选型仍得逐项比。
依据
Simon Willison 在 15th September 2026 的记录里说,Google 当天发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,两个 speech-to-speech(语音进、语音出,不经文字中转)模型,形态与 OpenAI 的 GPT-Live 家族相似。他把 GPT-6 Astra Extra High 对着文档指过去,让它搭出试用页面:选模型与音色、填可选 system prompt,然后在浏览器里开始语音对话,并且能在模型说话时打断。机制上这个页面不用任何库,直接连 BidiGenerateContent 的 WebSocket(一种保持长连接的双向通信协议)端点,用 Web Audio API 的 AudioContext(浏览器里负责采集与播放音频的接口)同时做采集和播放——省掉的是服务端音频中转,留下的是必须一直挂着的实时会话。他站内标签计数里 websockets 是 21、speech-to-text 也是 21,都远小于 google 的 416 和 llms 的 1,958,这类实时语音条目在他长期跟踪的样本里仍是少数。
- 选模型与音色选定
- 填可选 system prompt开始
- 浏览器采集音频推流
- WebSocket 双向流随时
- 说话中途打断
没写清 材料没给两个新模型的定价、延迟和语言覆盖,也没说打断之后上下文怎么续,所以不能替它们补上这几项。
下一步 按他给的那条 BidiGenerateContent WebSocket 端点去查配额与计费页,确认 Extended Thinking 是否单独计费。