OpenAI 正式发布了 gpt-realtime-mini,实时语音模型全面升级。
核心变化:
- 语音质量大幅提升 —— 新模型在自然度、情感表达、多语言切换上都有明显进步,不再是那种一听就知道是AI的声音
- 响应延迟更低 —— 从用户说话到模型回复的时间缩短了近40%,对话体验更接近真人
- 成本暴降 —— 每百万token的价格只有之前realtime的一半,开发者可以用更低的成本搭建实时语音应用
- 支持20+种语言 —— 中文、日文、韩文等亚洲语言的支持质量也有显著提升
这意味着什么?
实时语音AI正在从「能用」走向「好用」。当延迟降到200ms以下,人类已经很难区分对面是AI还是真人。
有开发者已经用它搭了实时翻译助手、语音客服、甚至AI陪练教练,反馈都不错。
值得关注的是,这次发布暗示OpenAI在实时交互这条赛道上加速布局。语音将成为AI的下一个主流交互方式,而不只是文字的附属。









