英伟达开源Molt智能体训练框架 8.6K行代码

时间:2026年8月1日 地点:美国加州圣克拉拉(NVIDIA总部) 人物:NVIDIA NeMo团队,论文作者Jian Hu、Huiying Li、Hao Zhang、Pavlo Molchanov、Jan Kautz、Yi Dong 事件详情:NVIDIA NeMo团队8月1日正式开源发布Molt——一款专为智能体强化学习研究打造的PyTorch原生训练框架。Molt以代码足够小、足够清晰为设计目标,整套强化学习训练代码仅约8.6K行;相比之下主流框架verl约62K行、slime约25K行、OpenRLHF约7.2K行。Molt采用Apache 2.0协议开源,配套发布启动脚本、Slurm作业脚本和预构建容器,可直接上手。同步公开的研究论文《A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning》(arxiv 2607.21653)已在arXiv上线。框架采用Ray负责调度与异步队列、vLLM负责rollout推理、NVIDIA AutoModel搭配FSDP2负责训练的「三组件一循环」架构,没有对任何上游组件做定制Fork,可随上游升级平滑迭代。预置配方需2节点共16张H100 GPU(8张训练+8张rollout),支持多轮工具调用智能体、代码执行智能体、视觉语言环境、LLM-as-judge奖励循环和On-Policy蒸馏等场景,可扩展到万亿参数级MoE。 背景:随着大模型智能体从单步问答迈向多轮工具调用、代码执行、长链路任务执行,强化学习后训练成为各家实验室提升智能体能力的关键路径。但主流RL框架普遍存在算法改动牵动多层的问题——训练器、分布式后端、rollout引擎胶水代码互相纠缠,研究者每次迭代都要付出大量工程成本。NVIDIA作为全球AI算力核心供应商,长期布局NeMo系列训练与强化学习工具栈,从NeMo RL到AlpaGym、再到Polar,已经形成多套针对自动驾驶、辅助驾驶、代码智能体的RL工具。Molt则定位为研究基础设施,优先解决研究迭代速度问题。 影响: - 智能体RL研究的迭代门槛显著降低,8.6K行代码量让AI编码助手可完整阅读,提升算法实验效率 - 加速产业界与学术界对MoE、多模态、多轮工具调用智能体的RL后训练探索 - NVIDIA补齐PyTorch原生智能体RL版图,与Megatron-LM等成熟栈形成小而精的差异化路线 - 智能体赛道竞争从模型层延伸至训练框架层,RL工具栈成为下一阶段重点 总结:Molt是NVIDIA在智能体RL工具链上的又一次重要开源发布,通过极致精简的代码量与PyTorch原生架构,让「AI自己改AI」成为可行范式。配合vLLM、Ray等成熟组件,Molt降低了智能体强化学习研究的工程负担,也巩固了NVIDIA在AI基础设施生态中的核心地位。 参考来源: - https://www.marktechpost.com/2026/08/01/nvidia-ai-releases-molt-a-pytorch-native-agentic-reinforcement-learning-framework/ - https://arxiv.org/abs/2607.21653 - https://github.com/NVIDIA-NeMo/labs-molt - https://www.jiqizhixin.com/ - https://the-decoder.com/ - https://www.unite.ai/