#AI
OpenAI 拆解 GPT-Live 实时语音架构
OpenAI 发布 GPT-Live 第三代实时语音系统,内核变化是移除传统语音对话中的 turn detector,改用全双工流式语音模型,同时听与说,不再依赖回合切割启动推理。
技术栈方面,媒体前端与推理逻辑由 Python asyncio 替换为 Go,帧传输平滑度提升,p95 延迟匹配旧系统 p50;底层使用 WebRTC 应对丢包、时钟漂移和网络切换。系统设计异步代理边界,隔离媒体路径与应用进程逻辑,在语音模型持续输出时可后台调用 GPT-5.5 处理搜索、推理及工具调用,不打断对话。
工程挑战聚焦于有状态推理:长会话导致上下文膨胀,模型实例频繁启停。团队实现热切换机制,在不中断对话前提下压缩上下文、重建 KV cache,透明迁移至新实例。
💡 为什么值得看官方深度公开第三代语音系统完整架构,从模型到传输的全链路工程解读,对语音产品开发者有直接参考价值。
查证
来源档案
OpenAI 官方工程博客
OpenAI 技术团队博客拆解 GPT-Live 系统架构、工程挑战与解决方案,由 Justin Uberti 和 Zahan Malkani 撰写,内容详实。
官方一手技术源,内容具体到协议选型、延迟指标、编程语言替换等技术细节,可信度高。
延伸阅读
原文包含完整的技术架构决策(qps/延迟数据、状态管理、传输协议选型),对实时语音系统设计的参考价值远超任何第三方解读。