#AI
OpenAI 公开 GPT-Live 连续语音架构
OpenAI 正式公开了 GPT-Live 的技术架构。这是其第三代语音系统,内核变革是**拔掉了“抢话探测器”**,彻底解决人机对话中“打断你还是让你等”的难题。
GPT-Live 的语音模型是**全双工**的,能同时听和说,不需要等你说完再判断何时回话。当需要深度推理或调用工具时,系统会**异步“摇人”** ,求助 GPT-5.5 等前沿模型,在此期间通话主路完全不受影响,保持零卡顿的自然交互感。
这一体验由自研的**低延迟流式架构**支撑。媒体传输与推理逻辑被彻底解耦,内核音频路径用 Go 重写,不再阻塞等待。配合动态上下文压缩和无缝实例切换,系统能在不间断对话的前提下自动整理长会话记忆。该技术已落地 ChatGPT Voice,用于桌面端的电脑操控和多代理协同。
💡 为什么值得看全双工语音模型上线,拔掉“抢话探测器”,人机对话首次不打断、不等待。
查证
来源档案
OpenAI 官方博客
一手工程博客,详述 GPT-Live 从架构决策到生产部署的技术实现。
产品架构的权威一手来源。但此文为技术宣传,缺失实测延迟数据与成本估算,且未提及全双工模式下的误打断率。
延伸阅读
拆解状态推理、动态压缩与 WebRTC 优化,展示大厂实时 AI 工程难度,适合后端及实时系统工程师。