时间:2026年7月30日
地点:英国伦敦
人物:PolyAI公司
事件详情:PolyAI于7月30日正式发布Dialog-RSN-1,这是一款原生音频对话大模型,将turn-taking、语音识别、函数调用和响应统一进单一音频原生模型,TTS模块保持独立输出。该模型已在企业生产环境处理真实通话,延迟区间280至500毫秒,稳定在300毫秒以内。相比之下,OpenAI GPT-realtime-2.1延迟通常在860至1900毫秒。模型延迟已接近200至300毫秒的人类自然对话停顿区间,能更好地捕捉用户犹豫、口音与环境噪音等非言语线索。
背景:当前语音AI市场存在两条主流技术路线。一是级联架构,把ASR、LLM与TTS串联,文本转录后丢失语调与口音信息;二是端到端语音-语音模型,如GPT-realtime和Gemini Live,把语音能力嵌入模型,但定制声音成本高、流式硬件开销大。PolyAI的Dialog-RSN-1开辟第三条路径,融合原生音频理解与TTS解耦,通过监督微调与强化微调对开源多模态基座后训练。PolyAI创立于2017年,2025年12月完成8600万美元D轮融资,累计服务超100家企业客户、2000+生产部署。
影响:
- 通话延迟300毫秒对齐人类自然对话节奏,大幅降低AI不当打断与用户挫败感
- 在餐饮集团场景,问题自主解决率相对提升11%;在保险公司场景,端到端延迟下降37%
- 模型可识别非言语线索,捕捉犹豫、修正发音、察觉情绪升级,提升复杂客服场景的服务质量
- 支持A100 GPU部署8B密集或30B稀疏模型,把企业级语音Agent成本压到商用可行区间
总结:PolyAI的Dialog-RSN-1介于传统级联与语音-语音模型之间,开创原生音频理解加TTS独立输出的中间路线。该模型300毫秒级响应速度与可定制TTS分离的双重优势,正在把语音AI客服从功能性应答推向自然交流新阶段。对正在餐饮、保险、零售、医疗等高通话量行业部署AI Agent的企业来说,延迟对齐人类真实节律、声音可控私有部署,正是这场语音AI体验升级的核心竞争力。
参考来源:
- https://poly.ai/blog/PolyAI-dialog-rsn-1
- https://poly.ai/dialog-rsn-1-early-access
- https://www.marktechpost.com/2026/07/30/polyai-releases-dialog-rsn-1-an-audio-native-dialog-model-that-fuses-turn-taking-speech-recognition-function-calling-and-response/
- https://news.qq.com/rain/a/20260730A0BC9A00
- https://huggingface.co/PolyAI