时间:2026-09-27
地点:美国加州圣克拉拉(NVIDIA 总部)
人物:NVIDIA NeMo 团队、Sortformer 架构作者 David AI(训练数据合作方)
事件详情:2026 年 9 月 23 日,NVIDIA 在 Hugging Face 开源发布 Nemotron 3 Diarization,一款约 1 亿参数的开放权重说话人分离(Speaker Diarization)模型。该模型可同时识别并区分多达 8 位说话人,原生支持重叠语音检测,单个权重文件可同时处理离线录音与实时流式音频,延迟档位涵盖 30.4 秒(离线)至 0.32 秒(超低延迟)四个等级。在 VoiceArena 初始版 Diarization-Bench 评测中,Nemotron 3 Diarization 以 14.72% 的 DER(Diarization Error Rate)排名第一,比第二名 19.3% 相对降低 24%;相对自家上一代 Streaming Sortformer 4 说话人版本,在 1.04 秒延迟下 8 项测试场景平均 DER 相对降低 41%。模型权重采用 OpenMDW License v1.1 授权,允许商业用途,配套 NVIDIA NeMo 工具链可部署在 Ampere、Ada Lovelace、Hopper、Blackwell GPU 上,与 Parakeet TDT 0.6B v3 语音识别模型组合即可生成带说话人标签(如 "speaker_2")的转写文本;Argmax 已宣布在 Pro SDK 3 中集成,Baseten 和 DigitalOcean 提供推理服务。
背景:说话人分离(Speaker Diarization)解决的是 ASR 转写无法回答"谁说了什么"的难题,长期依赖分段加嵌入聚类的两段式管线,错误率高且难以实时化。NVIDIA 此前的 Streaming Sortformer 只支持 4 说话人,复杂多人会议、播客、电话客服等场景长期受限。Nemotron 3 Diarization 把 Sortformer 架构升级为 31 层 Transformer 编码器 + RoPE 旋转位置编码,按说话人首次到达时间锁定通道排序,配合 Arrival-Order Speaker Cache(AOSC)与 FIFO 队列两套记忆机制,让流式推理中说话人标签保持稳定、不发生 permutation drift。
影响:开源 8 说话人 + 实时能力意味着会议纪要、呼叫中心质检、播客流水线、语音 Agent 记忆系统可在 0.32 秒量级做到说话人级归属,叠加 LLM 后能直接产出"谁承诺了什么、谁提出了异议"的结构化摘要,显著降低会议/客服自动化方案的工程门槛;对依赖闭源 diarization 服务的厂商(如部分 Nuance、AWS Transcribe 场景)形成直接竞争压力;OpenMDW-1.1 商业授权进一步把 NVIDIA 的"小模型 + 大生态"打法从 LLM 延伸到语音栈。
总结:NVIDIA 把过去需要复杂管线 + 闭源服务的多人语音分离能力,压缩到 1 亿参数单权重文件,14.72% DER 登顶 VoiceArena 同时允许商用,标志实时多人语音归属进入开源普及阶段。
参考来源:
1. https://the-decoder.com/nvidia-drops-a-free-100m-parameter-model-that-identifies-up-to-eight-speakers-in-real-time/
2. https://huggingface.co/nvidia/Nemotron-3-Diarization
3. https://www.unite.ai/nvidia-releases-nemotron-3-diarization-open-weight-speaker-model/
4. https://tradepoint.io/nvidia-releases-nemotron-3-diarization-a-100m-parameter-open-weight-model-that-tracks-8-speakers-in-real-time
5. https://beta.hyper.ai/en/stories/165ac02a206f8f50d2e04d674d7a2689
6. https://korshunov.ai/en/article/27888-nvidia-releases-nemotron-3-diarization-a-100m-parameter-model-tracking-8
7. https://metaailabs.com/nvidia-releases-nemotron-3-diarization-a-100m-parameter-open-weight-model-that-tracks-8-speakers-in-real-time







