#AI
OpenAI 把满双工语音模型 GPT-Live-1 开放进 API
OpenAI 于 9 月 10 日把 GPT-Live-1 放进 API,主打**满双工**语音对话:模型边听边说,不再走「语音转文字 → 语言模型 → 文字转语音」的串行三段式。官方描述的卖点是更强的指令遵循、自定义音色,以及**电话接入**能力 —— 后者意味着调用中心、电话客服这类场景可以直接接进开发者自己的产品里。
定价上,语音层按 **$0.05/分钟** 计,后端负责深度推理与工具调用的模型费用另算 —— 也就是说这个价买到的是「说话」这一层,不是整条 agent 链路。完整的能力清单、延迟数据与接入方式见 OpenAI 官方发布页与开发者文档。
💡 为什么值得看满双工架构首开放,语音 agent 成本压到 $0.05/分钟。
查证
来源档案
OpenAI 官方发布页(openai.com/index…
OpenAI 一手官方产品发布公告,坐标系为 tier 0;同题另有 TechTimes、DataStudios 等二手报道与官方开发者文档模型页。
发布事实本身为官方一手,可信度高;具体价格与能力边界以官方页为准,第三方媒体给出的延迟与用量数字属其自行梳理,未在本次可得证据中与官方口径逐一核对。
延伸阅读
想判断自建语音栈该不该换架构的团队,应看官方页里对串行三段式痛点的描述与 GPT-Live-1 的替代路径,以及电话接入的支持范围。
语音层与后端推理分开计费,意味着真实成本取决于调用哪个推理模型、跑多少工具;评估单位经济模型时不能只看这一个数字。