2026年8月9日,NVIDIA(英伟达)发布NemotronLabs VoiceChat 11B,一个11B参数的端到端实时全双工语音对话模型,已开源在Hugging Face平台。
NVIDIA总部位于加利福尼亚州圣克拉拉;模型权重和容器镜像已在Hugging Face公开,GitHub代码仓库同步开放。
NVIDIA NeMo / NemotronLabs 团队(隶属NVIDIA Research)。
NVIDIA发布NemotronLabs VoiceChat 11B,采用统一架构在单一模型内联合完成流式语音理解与语音生成,取代传统级联架构(ASR→LLM→TTS),端到端延迟显著降低。
关键能力:
1. 450毫秒响应:Full-Duplex-Bench 1.0基准测试中测得448毫秒流畅轮次延迟。
2. 实时打断(Barge-in):支持用户中途打断,模型立即让出话语权,480毫秒接管率达1.00。
3. 业界首个开源全双工模型支持实时工具调用:通过独立输出通道生成脚本,配合运营方定义的"on-hold"提示音,在API调用过程中保持对话自然流畅。
4. 架构组成:Fast Conformer语音编码器(源自Nemotron-Speech-Streaming-En-0.6b)+ Nemotron Nano v2 9B语言模型主干 + NVIDIA TTS解码器与Codec,输出22.05kHz语音。
部署要求:至少一块80GB显存GPU(A100、H100、RTX 6000 Pro或B200,x86_64 Linux)。当前仅可用于研究目的,NVIDIA官方明确指出存在已知故障模式(两分钟音频上下文上限、多轮退化为无意义胡言、轮次结束后的失控自言、用户转录丢词)。
传统语音AI采用ASR→LLM→TTS级联架构,每环节增加延迟并损失信息;轮次判断依赖外部VAD模块。VoiceChat 11B将"听""思考""说"内化到同一网络,是业界首个支持实时工具调用的开源全双工模型,对标OpenAI Realtime API、Google Gemini Live、Moshi架构PersonaPlex。
1. 客服中心、汽车座舱助手、零售与得来速订餐、电信IVR现代化、游戏NPC对话、无障碍工具等延迟敏感场景可直接受益。
2. 加速开源语音Agent生态发展——开发者可在80GB显存GPU上自行部署,对比此前必须依赖付费API的封闭方案。
3. NVIDIA NeMo语音AI工具栈再添旗舰模型,巩固其在语音大模型基础设施领域的主导地位。
4. 与字节Seed团队SeedRealtime(全双工音视频LLM)同期发布,全双工多模态交互正式进入"百模大战"阶段。
NVIDIA NemotronLabs VoiceChat 11B是开源语音AI的一个里程碑——它用11B参数量和450毫秒延迟,把此前必须依赖付费API的实时全双工能力带到了开源社区。尽管当前仅供研究使用,但其架构设计(Fast Conformer + Nemotron Nano v2 + 工具调用旁路)为下一代生产级语音Agent奠定了清晰的技术路径。
参考来源:
1. NVIDIA模型页面(Hugging Face官方):https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B
2. MarkTechPost深度解读:https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling/
3. NVIDIA NeMo代码仓库:https://github.com/NVIDIA-NeMo/Speech/tree/nemotron-labs-voicechat
4. Full-Duplex-Bench 1.0论文:https://arxiv.org/abs/2503.04721
5. NVIDIA Nemotron-Speech-Streaming编码器:https://huggingface.co/nvidia/nemotron-speech-streaming-en-0.6b
6. NVIDIA Nemotron Nano v2 LLM主干:https://huggingface.co/nvidia/NVIDIA-Nemotron-Nano-9B-v2
7. NVIDIA语音AI开源博客:https://blogs.nvidia.com/blog/speech-ai-dataset-models/









