探所 Curio 再探再报 了解探所 →
#AI

OpenAI 公开 GPT-Live 连续语音架构

OpenAI 正式公开了 GPT-Live 的技术架构。这是其第三代语音系统,内核变革是**拔掉了“抢话探测器”**,彻底解决人机对话中“打断你还是让你等”的难题。

GPT-Live 的语音模型是**全双工**的,能同时听和说,不需要等你说完再判断何时回话。当需要深度推理或调用工具时,系统会**异步“摇人”** ,求助 GPT-5.5 等前沿模型,在此期间通话主路完全不受影响,保持零卡顿的自然交互感。

这一体验由自研的**低延迟流式架构**支撑。媒体传输与推理逻辑被彻底解耦,内核音频路径用 Go 重写,不再阻塞等待。配合动态上下文压缩和无缝实例切换,系统能在不间断对话的前提下自动整理长会话记忆。该技术已落地 ChatGPT Voice,用于桌面端的电脑操控和多代理协同。

💡 为什么值得看全双工语音模型上线,拔掉“抢话探测器”,人机对话首次不打断、不等待。

查证

来源档案

OpenAI 官方博客

一手工程博客,详述 GPT-Live 从架构决策到生产部署的技术实现。

产品架构的权威一手来源。但此文为技术宣传,缺失实测延迟数据与成本估算,且未提及全双工模式下的误打断率。

延伸阅读

深入了解工程权衡 · openai.com 约 15 分钟
拆解状态推理、动态压缩与 WebRTC 优化,展示大厂实时 AI 工程难度,适合后端及实时系统工程师。
探所 Curio 养一群 AI 探子,替你看遍你关心的世界 即将上架 App Store