Miles 今日发布
企业级RL框架,面向大规模语言模型后训练的开源强化学习库
Miles 简介
Miles 是一个面向企业级应用的开源强化学习框架,专注于大规模语言模型(LLM)和视觉语言模型(VLM)的后训练(Post-training)阶段。项目由 radixark 团队开发维护,fork 自 SGLang 生态并与之协同演进,目标是为研究团队和企业提供一套简单、高效、稳定的大模型训练解决方案。2026 年 8 月正式发布 v0.1 里程碑版本,已在 LMSYS 博客记录了多项前沿技术突破。
核心功能
- PPO 与 GRPO 双算法支持:内置支持业界主流的强化学习算法 PPO(Proximal Policy Optimization)以及专为 LLM 优化的 GRPO(Group Relative Policy Optimization),适配不同训练场景的需求。
- 分布式训练优化:支持 NVIDIA GPU 的 BF16/FP16 混合精度训练,并率先实现对 Blackwell 架构原生 MXFP8 和 NVFP4 低比特精度的端到端 RL 训练支持,大幅降低算力成本。
- Day-0 模型支持:与 SGLang 深度集成,可在新模型发布当天即获得支持,目前已实现对 Kimi K3、Inkling 多模态模型等的 Day-0 支持。
- On-Policy 蒸馏:实现了在线策略蒸馏机制,在训练过程中持续优化策略网络,提升模型输出的质量与一致性。
- 完善的文档体系:提供从快速入门到高级调优的完整文档,包含 API 参考、模型支持列表与最佳实践指南。
- Slack 社区支持:接入 SGLang 官方 Slack 社区(#miles-rl 频道),开发者可获得快速的技术支持与经验交流。
- Miles Diffusion 扩展:配套开源项目 miles_diffusion,支持扩散模型与 RL 的结合探索,覆盖更广泛的生成式 AI 后训练需求。
技术实现
Miles 的核心架构基于 PyTorch 构建,采用分布式 actor-learner 分离设计。Actor 负责生成回复并与环境交互,Learner 基于收集到的 experience tuple 执行策略梯度更新。框架利用 DeepSpeed 进行大规模并行训练优化,支持数据并行、模型并行与流水线并行三种并行策略的灵活组合。在数据管道上,Miles 通过高效的提示词批处理与动态序列长度调度,最大化 GPU 利用率。框架还引入了自适应学习率调度与梯度裁剪稳定机制,在大规模分布式场景下保证训练过程的数值稳定性。v0.1 版本重点优化了通信效率,在 64 卡以上规模下仍能保持接近线性的加速比。
快速上手
第一步:安装 Miles。推荐使用 pip install miles-rl 或通过 GitHub 拉取源码进行安装,Docker 环境提供一键部署方案。
第二步:准备训练数据。Miles 支持 HuggingFace dataset 格式,准备包含 prompt 与参考回复的 JSONL 数据集即可。
第三步:配置训练参数。编辑 YAML 配置文件,设置模型路径、学习率、批量大小、RL 算法类型(PPO 或 GRPO)等关键参数。
第四步:启动分布式训练。使用 torchrun 或 DeepSpeed launcher 启动多卡训练,Miles 自动处理分布式初始化与梯度同步。
第五步:监控与评估。框架集成 Weights & Biases 支持,实时监控训练指标包括 reward 曲线、KL 散度与生成质量评估。
适用人群
- AI 研究机构:从事大模型后训练研究的高校实验室与研究院所,需要稳定高效的 RL 训练框架。
- 企业 AI 团队:有自研模型需求的中大型科技公司,在自有 GPU 集群上微调垂直领域大模型。
- 开源社区贡献者:对 RLHF 与大模型训练感兴趣的开发人员,可参与框架功能开发与模型生态建设。
官网链接
评论与建议
登录 后参与评论或提建议