跳到正文

AI工具Simon Willison06:47

Gemini Live 音频

Gemini Live audio

Gemini Live 强化音频,但适用场景仍限实时语音互动

判断

要接语音代理的团队,可以把服务端音频中转这一步从排期里删掉,直接在浏览器里连 Gemini 3.8 Live;但它只吃实时语音这一段,与 OpenAI 的 GPT-Live 是同一形态,选型仍得逐项比。

依据

Simon Willison 在 15th September 2026 的记录里说,Google 当天发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking,两个 speech-to-speech(语音进、语音出,不经文字中转)模型,形态与 OpenAI 的 GPT-Live 家族相似。他把 GPT-6 Astra Extra High 对着文档指过去,让它搭出试用页面:选模型与音色、填可选 system prompt,然后在浏览器里开始语音对话,并且能在模型说话时打断。机制上这个页面不用任何库,直接连 BidiGenerateContent 的 WebSocket(一种保持长连接的双向通信协议)端点,用 Web Audio API 的 AudioContext(浏览器里负责采集与播放音频的接口)同时做采集和播放——省掉的是服务端音频中转,留下的是必须一直挂着的实时会话。他站内标签计数里 websockets 是 21、speech-to-text 也是 21,都远小于 google 的 416 和 llms 的 1,958,这类实时语音条目在他长期跟踪的样本里仍是少数。

  1. 选模型与音色
    选定
  2. 填可选 system prompt
    开始
  3. 浏览器采集音频
    推流
  4. WebSocket 双向流
    随时
  5. 说话中途打断
浏览器里从选模型到中途打断的语音会话步骤

没写清 材料没给两个新模型的定价、延迟和语言覆盖,也没说打断之后上下文怎么续,所以不能替它们补上这几项。

下一步 按他给的那条 BidiGenerateContent WebSocket 端点去查配额与计费页,确认 Extended Thinking 是否单独计费。

本期其他新闻

  1. 行业动态

    AI“演员”Tilly Norwood 告诉我“所有生命都重要”

    Wired AI

  2. 行业动态

    圆桌讨论:AI 真的会杀死我们所有人吗?

    MIT Technology Review AI

  3. 行业动态

    宣布推出 Amazon SageMaker AI 训练任务的实例偏好列表

    AWS Machine Learning Blog

  4. 行业动态

    你的 Agent 完成了任务。它还能再做一次吗?

    Hugging Face

  5. AI工具

    使用 Amazon Bedrock 提示缓存优化成本与延迟

    AWS Machine Learning Blog

  6. 精选深读

    推出 Gemini 3.8 Live 和 3.8 Live Extended Thinking

    Google DeepMind

  7. 精选深读

    游戏中习得的技能能迁移到现实工作吗?

    Latent Space