时间:2026 年 9 月 27 日晚,北京 AI 初创公司 NaiveAI 在 Hugging Face 上以 MIT 协议开源了首個前沿级开源模型 Naive-N0.5-Flash。
地点:模型权重与推理代码发布于 Hugging Face(NaiveAI/Naive-N0.5-Flash)与 GitHub;团队总部位于北京。
人物:NaiveAI 创始人兼 CEO Jifeng Dai(戴季峰,前微软亚洲研究院 / 商汤科技背景);公司研究团队;致谢名单中的 Xiaomi MiMo 团队(提供基础模型)、DeepSeek 团队(提供 DSA 稀疏注意力设计)、SGLang 团队(推理基础设施支持)。
事件详情:Naive-N0.5-Flash 是一个总参数 309B、每 Token 仅激活 15.5B 参数的混合专家(MoE)模型,主打代码与 AI 研发两类负载。它通过 39 层滑动窗口注意力(SWA)+ 9 层 DeepSeek 稀疏注意力(DSA)的混合架构实现原生 1M Token 上下文,是首个完全去掉全注意力层的前沿规模开源模型。模型以小米开源的 MiMo-V2.5 为底座,在 1M 上下文原生设置下完成 3.25T Token 多阶段训练(50B 索引器热身 + 3T 稀疏注意力训练 + 200B 学习率衰减)。推理侧,团队自研 NaiveRT 栈,结合 mega-kernel 融合、PDL、投机解码与 FP8 混合精度,在 Ultrafast 模式下对单用户可达约 2000 Token/s。模型权重与推理代码以 MIT 协议开源,API 报价 $0.10 / $0.40 / $0.01(输入 / 输出 / 缓存读取,每百万 Token)。
背景:NaiveAI 由前微软亚研院与商汤背景的戴季峰创办,据报道估值约 14 亿美元。公司的自我定位是「用 AI 造 AI」——研究人员设定目标与评测协议,AI 系统承担架构探索、训练优化与推理栈调优等具体工程任务。NaiveRT 推理基础设施周服务量约 1000 万个沙箱,峰值 10 万并发。这次的架构关键是用 DeepSeek 的 DSA 替换原来 MiMo-V2.5 中的全局注意力层,从而避开百万 Token 上下文下全局注意力主导的解码开销。致谢中明确提到 MiMo 团队、DeepSeek 团队与 SGLang,整个项目站在中国过去两年开源大模型的成果之上。
影响:MIT 许可放开权重意味着任何公司、实验室甚至个人开发者都能直接下载部署这条模型。$0.10 / 百万 Token 的输入价已经显著低于 GPT-6 Sol 的 $2 / 百万 Token,约为二十分之一,把前沿级 1M 上下文模型的价格压到了此前中端档位的水平。这条新闻同时承载两层信号:一是中国开源模型阵营继续从「全注意力 + 大参数」向「稀疏注意力 + MoE」分流,DeepSeek、Kimi、Qwen、GLM、MiniMax 之外又多了 NaiveAI;二是「AI 主导 AI 研发」的叙事有了具名的开源落地样本,验证 AI 工具体系能否实质性推进前沿研究本身。
总结:NaiveAI 用 309B MoE + 全稀疏注意力 + AI 自主研发这套组合,把前沿级 1M 上下文模型压到 MIT 许可证和约 0.1 美元/百万 Token 价位;这是中国开源大模型「稀疏化」路线分歧的延伸,也是「AI 造 AI」从口号走向可下载样本的标志性一步。
参考来源:
1. Hugging Face 模型页 https://huggingface.co/NaiveAI/Naive-N0.5-Flash
2. AGI Hunt 详细报告 https://agihunt.info/en/e/1a0e3e808716f119c0b6d65e74f
3. AI Weekly 模型分析 https://aiweekly.co/alerts/naiveai-open-weights-309b-moe-naive-n05-flash-with-no-full-attention-layers
4. BitTide 模型数据 https://bittide.aicompass.dev/article/5b861ad6-a1af-40d2-9ff9-ebb28a14592d
5. AllWorld Media 报道 https://allworld.media/en/article/189993527
6. 新浪科技「戴季峰团队首个模型开源」 https://k.sina.com.cn/article_3996876140_ee3b7d6c001017siu.html







