#AI
Google 发布 Gemini 3.8 Live 语音模型
Google 发布 **Gemini 3.8 Live** 与 **Gemini 3.8 Live Extended Thinking** 两个语音到语音模型,形态与 OpenAI 的 GPT-Live 家族接近。前者主打流畅对话与视觉输入,后者在说话的同时做多步推理,面向复杂度更高的语音 agent 任务。
对开发者最直接的信号是接入路径:据 Simon Willison 的实测记录,两个模型已开放 **Gemini Live API**,通过一个 WebSocket 端点即可连接,他据此做了一个无第三方库的浏览器语音 UI,能选模型与音色预设、填系统提示词,并在模型说话时打断。语音栈不再必须自己串 ASR 加 LLM 加 TTS。
💡 为什么值得看语音原生模型可直接跑 agent 工具调用,开发者语音栈选型需重估。
查证
来源档案
Simon Willison's Weblog
个人技术博客,作者是知名的开发者与 AI 工具评测者,内容以自己写的实测工具为锚点,附带官方文档链接与可复现的代码 gist。
作者亲自动手接入了新模型并留下可复现实现,接入方式层面可信;但他只报了这一层,基准分数、价格、正式 GA 范围等均未涉及,这类信息需回到 Google 官方公告核对。
延伸阅读
作者给的是无库实现的 WebSocket 接入 + Web Audio 收发链路,拿它当最小可跑样本比自己读 API 文档快。