时间:2026 年 9 月 27 日报道(英伟达首发为 9 月 23 日)。
地点:美国加利福尼亚州圣克拉拉 / 全球开源社区。
人物:英伟达(NVIDIA)研究团队。
事件详情:英伟达正式开源 Nemotron 3 Diarization 说话人分离模型,仅 1 亿(100M)参数,可实时识别最多 8 位说话人,并能处理多人同时说话的重叠场景;模型权重以商业友好的 OpenMDW License 1.1 在 Hugging Face 公开发布,配套 NVIDIA NeMo 工具链,支持 Ampere / Ada Lovelace / Hopper / Blackwell 系列 GPU 部署,单卡 Linux 即可运行。该模型接受 16 kHz 单声道音频(.wav / .flac / .opus / .mp3),由 31 层 Transformer + RoPE 编码器处理 80 ms 帧,输出 [T, 8] 张量表示每位说话人的活跃概率;提供 30.4 秒离线、1.04 秒低延迟、0.64 秒超低延迟、0.32 秒极低延迟 4 档配置,可按场景选择延迟—精度平衡。
背景:说话人分离(Speaker Diarization)是"回答谁在何时说话"的关键步骤,传统 ASR 只能给出文字内容,无法分辨发言人;英伟达此前推出的 Streaming Sortformer 仅支持 4 人,新模型直接把上限翻倍到 8 人。同类工具以开源 pyannote speaker-diarization-3.1 为代表(4.5 倍实时速度、约 640MB 内存),而 Nemotron 3 走"端到端单卡"路线,依靠 Sortformer 架构 + Arrival-Order Speaker Cache 与 FIFO 上下文队列维持说话人标签稳定,避免跨 chunk 标签漂移。
影响:在 VoiceArena 首轮 Diarization-Bench 评测中(139 段英语对话、12 个系统、17 个配置),Nemotron 3 以 14.72% DER 排名第一,相对第二名 19.3% 错误率下降约 24%;在 8 个公开基准上对前代 Sortformer 平均相对降幅 41%,离线档 RTFx 达 15,113×(单卡 batch 32 编译后),可单卡实时处理约 500 路并发。发布当天 MacWhisper 15.2 即接入,Baseten day-0 上线,Transformers 与 Hugging Face Space 同日开通 demo;模型可搭配阿里的 Qwen3-ASR(22 种语言)或英伟达自家 Parakeet 使用。会议转录、客服分析、播客处理、语音 Agent 记忆系统均可直接获益。
总结:英伟达把多说话人实时识别做到了"单卡 8 人重叠"且开源商用,这是当前小尺寸模型在重叠语音场景下的最强水平,也是对话式 Agent 与会议 AI 工具链的关键拼图。
参考来源:
- The Decoder: https://the-decoder.com/nvidia-drops-a-free-100m-parameter-model-that-identifies-up-to-eight-speakers-in-real-time/
- Hugging Face 官方权重: https://huggingface.co/nvidia/Nemotron-3-Diarization
- AlphaSignal 技术解读: https://alphasignal.ai/news/nvidia-s-nemotron-3-beats-12-rivals-with-a-14-72-speaker-error-rate
- Meta Ai Labs 架构分析: https://metaailabs.com/nvidia-releases-nemotron-3-diarization-a-100m-parameter-open-weight-model-that-tracks-8-speakers-in-real-time
- VoiceArena Diarization-Bench 基准: https://voicearena.com/diarization-bench
- AI345 中文报道: https://www.ai345.info/post/post-1790263317421
- AGI Hunt 中文专题: https://agihunt.info/story/1a0cece98ecae54d2484876df97
- korshunov.ai 技术细节: https://korshunov.ai/en/article/27888-nvidia-releases-nemotron-3-diarization-a-100m-parameter-model-tracking-8
- WhatTheAI 简报: https://whattheai.tech/news/en/nvidia-releases-nemotron-3-ai-model-speaker-identification







