探所 Curio 再探再报 了解探所 →
#AI

OpenAI 发布 GPT-Live,语音模型进入全双工时代

OpenAI 今天正式发布 GPT-Live,这是 ChatGPT 语音体验的底层重构。GPT-Live 提供 GPT-Live‑1 与 GPT-Live‑1 mini 两个型号,即日起全球上线 iOS、Android 及网页端。付费用户默认使用 GPT-Live‑1,免费用户默认使用 GPT-Live‑1 mini,彻底替换 Advanced Voice Mode。

核心变化在于架构:GPT-Live 采用全双工设计,能同时听和说,每秒做出多次交互决策,如接话、继续听、暂停或调工具。用户可自然打断、停顿思考或要求模型闭嘴只听,不再被误打断或被迫轮流发言。遇到复杂问题时,GPT-Live 会后台委托 GPT‑5.5 处理,同时保持对话流畅。

💡 为什么值得看ChatGPT 语音交互从“轮流对讲”变成“实时对话”,背后是架构的根本性改变。

GPT-Live 与 Advanced Voice Mode 基准测试对比

**BrowseComp(智能体网页搜索)**

  • Advanced Voice Mode:0.7%
  • GPT-Live‑1 mini:31.6%
  • GPT-Live‑1 High:75.2%

**GPQA(科学推理)**

  • Advanced Voice Mode:45.3%
  • GPT-Live‑1 High:84.2%

**τ³-Voice Telecom(语音客服任务)**

  • Advanced Voice Mode:约 30% 成功率,处理时长约 385 秒
  • GPT-Live‑1 High:约 65% 成功率,处理时长约 385 秒
  • GPT-Live‑1 Instant:约 37% 成功率,处理时长约 225 秒

**人类偏好测试(5-10 分钟对话)**

  • GPT-Live‑1 对 Advanced Voice Mode:75.7% 偏好度
  • GPT-Live‑1 mini 对 Advanced Voice Mode:69.2% 偏好度

用户可在聊天中自选推理档位:Instant(快速响应)、Medium、High(最长思考时间),GPT-Live‑1 支持全部三档,mini 仅支持 Instant。

查证

来源与可信度

· 四项独立来源均确认产品已发布。 [4]
· 基准测试数据来自 OpenAI System Card 和官方博客,可交叉验证。 [1]
· TechCrunch 实测显示非英语语言(如印地语)实时翻译存在美式口音和生硬表达,官方承认可能存在非母语口音或流利度不足。 [2]
孤证 · Reddit 社区有用户反馈 demo 中的打断仍显突兀,实际体验待大规模上线后验证。 [5]

另有 1 个来源跟进

延伸阅读

只读一篇 · openai.com 约 10 分钟
官方博客含完整架构示意图、音频 demo 和三代表格对比,是理解技术演进的起点
换个视角 · the-decoder.com 约 8 分钟
TechCrunch 提供了独家实测细节和产品负责人 Atty Eleti 的完整引语,补足官方稿未涉及的真实体验短板
中文读者 · techcrunch.com 约 6 分钟
The Verge 从用户体验角度认为更新更“善于闭嘴”,便于快速理解其对日常使用的实际影响。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store