Miles
面向大模型后训练的强化学习框架,支持 SGLang + Megatron-LM 分布式 RL
项目简介
Miles 是 RadixArk 推出的企业级开源强化学习框架,专为大规模大语言模型(LLM)和视觉语言模型(VLM)的后训练(Post-Training)而设计。它整合了 SGLang(用于高吞吐量 Rollout)、NVIDIA Megatron-LM(用于可扩展分布式训练)、Ray(用于集群编排)和 PyTorch(作为通用数值计算层),旨在让前沿规模的大模型 RL 后训练更易于构建、复现和运维。Miles 已获得 PyTorch 官方博客推荐,被 IBM 等企业用于生产环境,GitHub Star 持续增长中。
核心功能
- 全异步 RL 训练:Rollout 和训练工作节点完全解耦,支持可配置的 on-policy 和 off-policy 调度策略,减少流水线气泡,提高 GPU 利用率
- Token-in-Token-Out(TITO):每个模型和黑盒 Harness 都支持Token-in-Token-Out 模式,Rollout 和训练之间无需 detokenize/retokenize 往返
- P2P RDMA 快速权重更新:通过 PCIe/NVLink RDMA 在数秒内将新权重从训练节点同步到 Rollout 引擎节点,即使在万亿参数模型(如 Kimi-K2.6)上也能实现快速策略更新
- 低精度训练:支持 MXFP8、NVFP4、INT4 QAT、BF16、FP16 等多种精度格式,数值稳定的 RL 配方减少精度导致的不稳定性
- LoRA 和多 LoRA:低秩适配器支持在部分 GPU 上训练万亿参数规模模型,同一适配器可直接加载到 SGLang 用于 Rollout
- Rollout Routing Replay(R3):在训练器前向传播中回放 Rollout 时记录的专家路由数据,解决 MoE 模型路由不匹配导致的大规模训练不稳定问题
- 故障容错:SGLang 引擎崩溃后 Miles 可自动恢复并原地继续运行,无需重启任务
- Day-0 前沿模型支持:发布首日即支持 DeepSeek-V4、Kimi-K3、Qwen3.5、GLM-5.2 等前沿开源模型
技术实现
Miles 遵循「小核心、多扩展」的设计理念,核心训练循环刻意保持精简,将最常需要修改的部分(Rollout 逻辑、奖励计算、损失函数、样本过滤、指标和训练钩子)作为用户提供的 Python 模块在启动时挂载。它整合了四大系统:SGLang 负责高吞吐量 Rollout 生成和 Router 调度;NVIDIA Megatron-LM 负责可扩展分布式训练;Ray 负责长时间运行 RL 任务的集群编排和资源调度;PyTorch 作为通用编程和数值计算层贯穿整个技术栈。R3(Rollout Routing Replay)机制记录 Rollout 期间的专家路由决策,在训练器前向传播时回放这些路由决策,保证 MoE 模型的 Rollout 和训练阶段路由行为一致,避免了传统方法中两个阶段路由不匹配导致的训练不稳定。P2P RDMA 权重传输在 disaggregated 部署场景下可实现跨节点秒级权重同步,显著减少 Rollout 和训练之间的等待延迟。整个框架支持 NVIDIA Blackwell、Hopper 和 Ampere 系列 GPU,以及 AMD Instinct(ROCm)。
快速上手
第一步,通过安装脚本一键安装 Miles(Linux/macOS):
curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash
Windows 用户可通过 PowerShell 原生安装(无需 WSL):
iex (irm https://hermes-agent.nousresearch.com/install.ps1)
第二步,拉取最新 Docker 镜像(或从源码安装):
docker pull radixark/miles:latest
第三步,编写训练脚本,例如使用 GRPO 算法训练 Qwen3-30B-A3B:
python train.py --advantage-estimator grpo --model-name qwen3-30b-a3b --hf-checkpoint /path/to/qwen3-30b-a3b-hf --rollout-batch-size 512 --n-samples-per-prompt 8
第四步,选择训练后端(Megatron-LM 或 PyTorch FSDP2)并配置集群资源;
第五步,Miles 自动处理故障恢复、检查点和权重同步,监控训练过程。
适用人群
- AI 实验室和大型科技企业:在大规模 GPU 集群上进行 RL 后训练,需要稳定可靠的生产级框架
- ML 工程师:构建 Agentic RL 流水线,需要高吞吐量 Rollout 和快速策略迭代
- 研究人员:在前沿模型(DeepSeek-V4、Kimi-K3 等)上进行 RLHF 和偏好学习研究
- 企业 AI 团队:需要支持 HIPAA 等合规要求的训练流程和完整可观测性
官方链接
官网:https://miles.radixark.com GitHub:https://github.com/radixark/miles
评论与建议
登录 后参与评论或提建议