时间:2026 年 9 月 10 日
地点:美国,旧金山 / 全球 API
人物:OpenAI 团队、Yelp CTO Alex Levy、Speak 公司团队
事件详情:2026 年 9 月 10 日,OpenAI 正式把 GPT-Live-1 实时语音模型通过 API 开放给开发者。GPT-Live-1 支持全双工(full-duplex)语音交互,可以边听边说,不再依赖传统 STT→LLM→TTS 串联链路,从而大幅降低延迟并避免交接抖动。
该 API 允许开发者把 GPT-Live-1 与 GPT-6 Astra 或第三方文本模型搭配,把推理和工具调用代理给后端模型处理,单价 0.05 美元/分钟。OpenAI 同时上线 12 种新音色,覆盖不同口音、方言和语言,并默认提供 ASR 转写与回复文本。
性能方面,OpenAI 基准显示 GPT-Live-1 在全双工交互测试中得分 80.1%,较 GPT-Realtime-2.1 的 45.4% 近乎翻倍;轮换延迟从 1.4 秒降至 0.8 秒;工具调用准确率从 60% 提升至 87%;银行语音客服基准通过率由 12.4% 提升至 32%。
背景:GPT-Live-1 此前已在 ChatGPT 中内置,本次是首次面向开发者开放,可用于电话客服、外语陪练、订餐订位等场景。Yelp 已用于电话预订,Speak 用于语言陪练,用户被打断率下降近 80%。
影响:全双工实时语音被视为大模型人机交互的关键拐点,0.05 美元/分钟的定价显著低于专业呼叫中心成本,将推动电话客服、语音 Agent、企业 IVR 等场景大规模落地;同时加剧与 ElevenLabs、Deepgram、Cartesia 等实时语音厂商的竞争。
总结:OpenAI 把 ChatGPT 已验证的"边听边说"全双工体验正式开放给开发者,叠加 12 种音色和 0.05 美元/分钟的价格,有望成为新一轮语音 Agent 应用爆发的底座。
参考来源:
1. https://openai.com/index/introducing-gpt-live-1-in-the-api/
2. https://the-decoder.com/openais-gpt-live-1-api-lets-developers-build-apps-that-talk-and-listen-at-the-same-time/
3. https://developers.openai.com/api/docs/live
4. https://the-decoder.com/chatgpt-can-now-listen-and-talk-at-the-same-time-making-ai-conversations-seem-more-human/
5. https://openai.com/index/introducing-gpt-live/
6. https://the-decoder.com/openai-releases-new-models-for-its-realtime-api/









