热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

英伟达开源100M参数模型 实时识别8位说话人

时间:2026-09-27 地点:美国加州圣克拉拉(NVIDIA 总部) 人物:NVIDIA NeMo 团队、Sortformer 架构作者 David AI(训练数据合作方) 事件详情:2026 年 9 月 23 日,NVIDIA 在 Hugging Face 开源发布 Nemotron 3 Diarization,一款约 1 亿参数的开放权重说话人分离(Speaker Diarization)模型。该模型可同时识别并区分多达 8 位说话人,原生支持重叠语音检测,单个权重文件可同时处理离线录音与实时流式音频,延迟档位涵盖 30.4 秒(离线)至 0.32 秒(超低延迟)四个等级。在 VoiceArena 初始版 Diarization-Bench 评测中,Nemotron 3 Diarization 以 14.72% 的 DER(Diarization Error Rate)排名第一,比第二名 19.3% 相对降低 24%;相对自家上一代 Streaming Sortformer 4 说话人版本,在 1.04 秒延迟下 8 项测试场景平均 DER 相对降低 41%。模型权重采用 OpenMDW License v1.1 授权,允许商业用途,配套 NVIDIA NeMo 工具链可部署在 Ampere、Ada Lovelace、Hopper、Blackwell GPU 上,与 Parakeet TDT 0.6B v3 语音识别模型组合即可生成带说话人标签(如 "speaker_2")的转写文本;Argmax 已宣布在 Pro SDK 3 中集成,Baseten 和 DigitalOcean 提供推理服务。 背景:说话人分离(Speaker Diarization)解决的是 ASR 转写无法回答"谁说了什么"的难题,长期依赖分段加嵌入聚类的两段式管线,错误率高且难以实时化。NVIDIA 此前的 Streaming Sortformer 只支持 4 说话人,复杂多人会议、播客、电话客服等场景长期受限。Nemotron 3 Diarization 把 Sortformer 架构升级为 31 层 Transformer 编码器 + RoPE 旋转位置编码,按说话人首次到达时间锁定通道排序,配合 Arrival-Order Speaker Cache(AOSC)与 FIFO 队列两套记忆机制,让流式推理中说话人标签保持稳定、不发生 permutation drift。 影响:开源 8 说话人 + 实时能力意味着会议纪要、呼叫中心质检、播客流水线、语音 Agent 记忆系统可在 0.32 秒量级做到说话人级归属,叠加 LLM 后能直接产出"谁承诺了什么、谁提出了异议"的结构化摘要,显著降低会议/客服自动化方案的工程门槛;对依赖闭源 diarization 服务的厂商(如部分 Nuance、AWS Transcribe 场景)形成直接竞争压力;OpenMDW-1.1 商业授权进一步把 NVIDIA 的"小模型 + 大生态"打法从 LLM 延伸到语音栈。 总结:NVIDIA 把过去需要复杂管线 + 闭源服务的多人语音分离能力,压缩到 1 亿参数单权重文件,14.72% DER 登顶 VoiceArena 同时允许商用,标志实时多人语音归属进入开源普及阶段。 参考来源: 1. https://the-decoder.com/nvidia-drops-a-free-100m-parameter-model-that-identifies-up-to-eight-speakers-in-real-time/ 2. https://huggingface.co/nvidia/Nemotron-3-Diarization 3. https://www.unite.ai/nvidia-releases-nemotron-3-diarization-open-weight-speaker-model/ 4. https://tradepoint.io/nvidia-releases-nemotron-3-diarization-a-100m-parameter-open-weight-model-that-tracks-8-speakers-in-real-time 5. https://beta.hyper.ai/en/stories/165ac02a206f8f50d2e04d674d7a2689 6. https://korshunov.ai/en/article/27888-nvidia-releases-nemotron-3-diarization-a-100m-parameter-model-tracking-8 7. https://metaailabs.com/nvidia-releases-nemotron-3-diarization-a-100m-parameter-open-weight-model-that-tracks-8-speakers-in-real-time