时间:2026 年 10 月 1 日
地点:美国西雅图(Ai2 总部)/ 全球开源社区
人物:Allen Institute for AI(Ai2,非营利 AI 研究机构)团队、Hugging Face 工程团队、开放模型社区开发者
事件详情:
Ai2(Allen Institute for AI)联合 Hugging Face 于 10 月 1 日发布 Olmo-core 3,开源面向万亿参数规模 MoE(Mixture-of-Experts)模型的训练框架。Olmo-core 3 重新设计了整套 MoE 训练系统,重点解决"专家规模扩大带来的吞吐损失"这一长期痛点。
在一项基准测试中,Ai2 把 MoE 的专家池(expert pool)从 8 个扩展到 128 个,每 token 仍只激活 4 个专家,单 token 活跃参数量稳定在约 3.2B;但模型总参数容量从 4.6B 飙升到 47B,训练吞吐量下降不到 5%。同一套基础设施已经在超过 1 万亿总参数的规模上完成基准测试。
Olmo-core 3 是下一代 Olmo 模型的核心系统之一,沿袭了 Ai2 的全栈开源路线:模型权重、训练数据(Dolma 3)、训练代码、训练配方(recipes)全部以开放许可证发布。代码仓库(allenai/OLMo-core)采用 PyTorch 原生模块化设计,目标是让学术机构和中小实验室也能训练万亿参数 MoE。
背景:
MoE 架构以稀疏激活换取参数规模红利,是 GPT-4、Mixtral、DeepSeek-V3 等模型的常用路线。但 MoE 训练需要把完整模型分散到 GPU 集群,并在不同节点间路由输入到对应专家,规模越大通信开销越容易反噬。Olmo-core 3 通过改进的调度、路由和分片策略,把扩展曲线压平。
影响:
1. 中小研究机构可低成本训练万亿 MoE,降低前沿模型开发门槛
2. 进一步强化"全栈开源"路线,与 Mistral、Qwen 等"开源权重 + 闭源训练栈"形成对比
3. 给万亿 MoE 训练提供现成模板,可能加速行业开源追赶闭源前沿
总结:
Olmo-core 3 不是新模型,而是一套让任何人都能训练万亿 MoE 的开源基础设施。Ai2 用近 2 年时间把"全栈开源"从 7B/32B 推向万亿规模,是开源阵营对抗闭源前沿的最新动作。
参考来源:
1. https://huggingface.co/blog/allenai/olmocore3 (Hugging Face 官方博客,原始发布)
2. https://github.com/allenai/OLMo-core (代码仓库)
3. https://allenai.org/papers/olmocore3 (技术报告)
4. https://x.com/allen_ai/status/2105679258165068097 (Ai2 官方 X 公告)
5. https://www.reddit.com/r/allenai/comments/1wv2z7m/olmocore_3_open_moe_training_infrastructure_with/ (社区讨论)
6. https://allenai.org/blog/olmo3 (Olmo 3 模型族介绍,Olmo-core 是其训练框架)
7. https://developer.nvidia.com/blog/efficient-moe-training-for-biological-foundation-models/ (MoE 训练基础设施背景)
8. https://huggingface.co/blog/moe (Hugging Face MoE 概念科普)







