热门AI工具推荐

焚书AI多模型聚合平台
AI多模型聚合平台( Claude 系列、GPT 系列)支持聊天、搜索、图片、视频、音乐等多种功能;聚合了 Claude 系列(如 Sonnet 5、Opus 5 等)、Gemini 系列、GPT 系列、DeepSeek(搜索模式默认调用 DeepSeek V4 Pro)以及通义千问、Kimi 等数十款国内外主流模型。
AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

英伟达开源100M说话人模型实时识别8人对话

时间:2026 年 9 月 27 日报道(英伟达首发为 9 月 23 日)。 地点:美国加利福尼亚州圣克拉拉 / 全球开源社区。 人物:英伟达(NVIDIA)研究团队。 事件详情:英伟达正式开源 Nemotron 3 Diarization 说话人分离模型,仅 1 亿(100M)参数,可实时识别最多 8 位说话人,并能处理多人同时说话的重叠场景;模型权重以商业友好的 OpenMDW License 1.1 在 Hugging Face 公开发布,配套 NVIDIA NeMo 工具链,支持 Ampere / Ada Lovelace / Hopper / Blackwell 系列 GPU 部署,单卡 Linux 即可运行。该模型接受 16 kHz 单声道音频(.wav / .flac / .opus / .mp3),由 31 层 Transformer + RoPE 编码器处理 80 ms 帧,输出 [T, 8] 张量表示每位说话人的活跃概率;提供 30.4 秒离线、1.04 秒低延迟、0.64 秒超低延迟、0.32 秒极低延迟 4 档配置,可按场景选择延迟—精度平衡。 背景:说话人分离(Speaker Diarization)是"回答谁在何时说话"的关键步骤,传统 ASR 只能给出文字内容,无法分辨发言人;英伟达此前推出的 Streaming Sortformer 仅支持 4 人,新模型直接把上限翻倍到 8 人。同类工具以开源 pyannote speaker-diarization-3.1 为代表(4.5 倍实时速度、约 640MB 内存),而 Nemotron 3 走"端到端单卡"路线,依靠 Sortformer 架构 + Arrival-Order Speaker Cache 与 FIFO 上下文队列维持说话人标签稳定,避免跨 chunk 标签漂移。 影响:在 VoiceArena 首轮 Diarization-Bench 评测中(139 段英语对话、12 个系统、17 个配置),Nemotron 3 以 14.72% DER 排名第一,相对第二名 19.3% 错误率下降约 24%;在 8 个公开基准上对前代 Sortformer 平均相对降幅 41%,离线档 RTFx 达 15,113×(单卡 batch 32 编译后),可单卡实时处理约 500 路并发。发布当天 MacWhisper 15.2 即接入,Baseten day-0 上线,Transformers 与 Hugging Face Space 同日开通 demo;模型可搭配阿里的 Qwen3-ASR(22 种语言)或英伟达自家 Parakeet 使用。会议转录、客服分析、播客处理、语音 Agent 记忆系统均可直接获益。 总结:英伟达把多说话人实时识别做到了"单卡 8 人重叠"且开源商用,这是当前小尺寸模型在重叠语音场景下的最强水平,也是对话式 Agent 与会议 AI 工具链的关键拼图。 参考来源: - The Decoder: https://the-decoder.com/nvidia-drops-a-free-100m-parameter-model-that-identifies-up-to-eight-speakers-in-real-time/ - Hugging Face 官方权重: https://huggingface.co/nvidia/Nemotron-3-Diarization - AlphaSignal 技术解读: https://alphasignal.ai/news/nvidia-s-nemotron-3-beats-12-rivals-with-a-14-72-speaker-error-rate - Meta Ai Labs 架构分析: https://metaailabs.com/nvidia-releases-nemotron-3-diarization-a-100m-parameter-open-weight-model-that-tracks-8-speakers-in-real-time - VoiceArena Diarization-Bench 基准: https://voicearena.com/diarization-bench - AI345 中文报道: https://www.ai345.info/post/post-1790263317421 - AGI Hunt 中文专题: https://agihunt.info/story/1a0cece98ecae54d2484876df97 - korshunov.ai 技术细节: https://korshunov.ai/en/article/27888-nvidia-releases-nemotron-3-diarization-a-100m-parameter-model-tracking-8 - WhatTheAI 简报: https://whattheai.tech/news/en/nvidia-releases-nemotron-3-ai-model-speaker-identification