时间:2026年8月11日
地点:美国
人物:英伟达(NVIDIA)
事件详情:英伟达正式开源Nemotron 3.5系列首款模型Nemotron 3.5 Lightning,采用混合Mamba-Transformer + MoE架构,总参数量31.6B、激活参数仅3.6B,支持1M token上下文,可单卡H100或DGX Spark(GB10)部署。该模型采用OpenMDW-1.1宽松许可,商业使用明确允许。Artificial Analysis基准显示其智能指数达24,与OpenAI gpt-oss-120b(24)持平,但参数量仅为后者的四分之一。推理速度上,NVFP4权重下达到每秒670 token,是同档模型中最快的,约为Google Gemini 3.5 Flash-Lite(386 token/s)的1.7倍,完成同等任务仅需0.5分钟(Qwen3.6 35B A3B需3.5分钟、Gemma 4 31B需5.8分钟)。智能体基准方面,GDPval-AA v2 Elo评分从490跃升至824(+334),超越gpt-oss-120b(800)和更大的Nemotron 3 Super(698);Terminal-Bench v2.1准确率从7%提升至24.3%,逼近gpt-oss-120b的26.2%。
背景:Nemotron 3.5 Lightning是6月发布的550B参数Nemotron 3 Ultra蒸馏版本,延续Nemotron 3 Nano的混合Mamba-Transformer架构,专为"长期运行的智能体系统"中高频次专用任务设计,可作为多模型编排体系中的"工作马"模型,承担代码审查、工具调用、安全告警监控、账单问答等子任务。同日英伟达还开源了NeMo Switchyard智能路由库,可在企业自有开源/闭源/NVIDIA模型组合中按需路由请求,无需重写应用。
影响:模型权重已在Hugging Face上线,DeepInfra、Fireworks、FriendliAI、CoreWeave、GMI Cloud、Nebius、Crusoe等多家推理服务商同步提供serverless推理,OpenRouter亦上线免费档位。CodeRabbit(代码审查)、Harvey(法律服务)、CrowdStrike(网络安全)、Lila Sciences(科研)、Fastino Labs(金融医疗)等企业已基于该模型微调专属智能体,标志着英伟达在开放权重生态下进一步抢占智能体基础设施入口。
总结:英伟达Nemotron 3.5 Lightning以31.6B总参/3.6B激活的紧凑结构,在保持与gpt-oss-120b相当的智能水平同时实现业界领先的推理速度,配合NeMo Switchyard路由库与多家推理服务商的全链路支持,正迅速成为智能体高频子任务的事实标准工作模型。
参考来源:
1. https://the-decoder.com/nvidias-open-weight-nemotron-3-5-lightning-prioritizes-speed-over-maximum-intelligence/
2. https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/
3. https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
4. https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
5. https://artificialanalysis.ai/models/nemotron-3-5-lightning
6. https://www.explainx.ai/blog/nvidia-nemotron-3-5-lightning-30b-a3b-open-moe-2026
7. https://news.ycombinator.com/item?id=49257947
8. https://www.nvidia.com/en-us/ai-data-science/foundation-models/nemotron/









