月之暗面开源MoonEP MoE分布式训练2.5倍

时间:2026年7月27日 地点:中国北京 人物:月之暗面(Moonshot AI)Kimi 团队 事件详情:月之暗面于 7 月 27 日深夜在 Kimi K3 Open Day 期间正式开源 MoonEP,这是一款面向超大规模混合专家(MoE)模型训练的高性能专家并行(EP)通信库,采用修改版 MIT 协议开放。MoonEP 与 FlashKDA、AgentEnv 一同发布,是支撑 2.8 万亿参数 Kimi K3 训练的三大 Infra 技术之一。MoonEP 通过「在线规划冗余专家 + 预取 + 反向梯度归约」机制,向所有 rank 硬保证「S × K token」均分,规避专家路由偏载(maxvio)造成的通信拖尾,使 Kimi K3 整体扩展效率较 K2 提升约 2.5 倍。代码已托管在 GitHub(MoonshotAI/MoonEP)仓库,对工业界与学术界免费下载与二次开发。 背景:MoE 通过把 token 路由到少数「激活专家」实现稀疏计算,但路由器天然不均衡——热门专家被 token 堆叠、冷门专家闲置,collective 的延迟被最慢 rank 拖垮,且每步 token 分布都在抖动,动态 shape 又会撕裂 GPU 显存、强制 host 同步。既有方案多依赖静态负载均衡或专家复制,缓解但未根治。MoonEP 给出一个工程级硬约束:每个 rank 都恰好吃到 S × K token(输入 token 数乘每 token 选中专家数),通过现网冗余专家与预取把「分摊」做成可调度问题。 影响: - 中国大模型基础设施首次以「训练栈全开源」形式对外输出 MoE 通信方法论 - 社区可在 Kimi K3 上以更低门槛复现万亿参数 MoE 训练,缓解偏载通信瓶颈 - 与 OpenAI、Google 等闭源体系的训练栈形成差异化,强化国产开源生态话语权 总结:MoonEP 不是单一模型,而是把 Kimi K3 训练栈里的通信黑箱变成了可查、可改、可复用的代码资产。开源许可证再次让中国团队站到全球 MoE 工程化的第一梯队,对推动万亿参数开源训练民主化与降低训练成本具有标志意义。 参考来源: - https://www.marktechpost.com/2026/07/29/moonshot-ai-open-sources-moonep-a-perfectly-balanced-expert-parallelism-library-for-moe-training/ - https://github.com/MoonshotAI/MoonEP - https://x.com/Kimi_Moonshot/status/2081763086281973847 - https://baijiahao.baidu.com/s?id=1871953483433565173&wfr=spider&for=pc - https://baijiahao.baidu.com/s?id=1871965972993374967&wfr=spider&for=pc - https://finance.sina.cn/2026-07-28/detail-inikknsc1916000.d.html - https://baijiahao.baidu.com/s?id=1871920137127587142&wfr=spider&for=pc - https://www2.yicaiglobal.com/news/moonshot-ais-kimi-k3-becomes-worlds-first-open-source-model-in-3-trillion-parameter-class - https://g.pconline.com.cn/x/2179/21792761.html - https://app.myzaker.com/news/article.php?pk=6a684ac8b15ec0342244a06b