时间:2026年8月4日
地点:美国旧金山
人物:Cursor Research(AI编程工具Cursor的研究部门)
事件详情:Cursor Research 8月4日正式开源 Mixture-of-Kittens(MoK),这是其编程模型 Composer 背后的 MoE 训练 megakernel,已支撑 Composer 在数万张 GPU 上的训练。MoK 将 MoE 训练中所有的通信与计算步骤融合进一个确定性 megakernel,单卡测试相比最强公开基线最高可获得 2.37 倍加速。代码以 Apache-2.0 协议在 GitHub 公开,同时配套博客技术详解。
背景:MoE 层在分布式训练中常消耗超过一半的端到端时间。Cursor 此前已自研 MXFP8/NVFP4 量化内核和 warp decode 推理路径,但随着训练迁移到 GB300 NVL72 机架,整机 72 颗 GPU 共享 NVLink 域让通信与计算的耦合更紧,原本由 CPU 负责的同步开销成为瓶颈。MoK 的设计目标是彻底去掉这条 CPU-GPU 同步路径。
影响:
- NVL72 上最高 2.37 倍 MXFP8 前向加速、1.78 倍反向加速,端到端 512 卡提升 1.41 倍
- 采用 pull 派发加 push 合并策略,把派发信令开销从 103 微秒压到 18 微秒(约 5.8 倍降幅)
- 环形 token buffer 完全去除 CPU 调度,训练过程零 token 丢弃,可直接服务于策略内 RL 后训练
- 但 MoK 限定 NVIDIA Blackwell SM100/SM103、PyTorch 2.10+ 与 CUDA 13.0+,仅 NVL72 持有者或租用者能落地
总结:MoK 的开源把原本只有头部实验室才能复现的 NVL72 训练优化开放给社区。它用确定性 megakernel 思路把 MoE 通信和计算彻底融合,再叠加 pull/push 派发和环形 token buffer 两个核心设计,把硬件利用率推到新的高度。但其硬性硬件门槛意味着短期受益者仍将是大型云厂、GPU neocloud 和国家算力中心,对单节点或 8 卡团队仍不友好。Cursor 也借此进一步巩固其在 AI 编程模型领域的技术话语权。
参考来源:
- https://www.marktechpost.com/2026/08/04/cursor-open-sources-mixture-of-kittens-mok-a-deterministic-moe-training-megakernel-for-gb300-nvl72-racks/
- https://cursor.com/blog/mixture-of-kittens
- https://github.com/cursor/mixture-of-kittens
- https://hazyresearch.stanford.edu/blog/2025-05-27-no-bubbles
- https://github.com/deepseek-ai/DeepEP
- https://arxiv.org/abs/2502.19811
- https://arxiv.org/abs/2512.14080