【时间】2026年8月11日
【地点】中国·杭州(蚂蚁集团总部)
【人物】蚂蚁集团百灵大模型团队
【事件详情】蚂蚁集团旗下百灵大模型于2026年8月11日正式开源轻量级混合推理MoE模型Ling-3.0-tiny。该模型总参数量为7.9B,每Token推理时仅激活1.3B参数,主打低成本本地与边缘部署。官方同步提供BF16、FP8与INT4三种精度权重版本,已在NVIDIA DGX Spark、MacBook及Mac mini等设备完成推理验证。
【技术亮点】Ling-3.0-tiny采用高效混合线性架构,将月之暗面(Kimi)自研的KDA(Kimi Delta Attention)与DeepSeek自研的MLA(多头潜在注意力)按3:1比例交替堆叠,并配备由128个路由专家组成的稀疏MoE前馈网络,每个Token仅激活8个路由专家与1个共享专家,在长上下文建模、参数效率与计算成本之间取得平衡。模型原生支持混合推理能力,可通过enable_thinking参数在单次请求中灵活开启或关闭思考模式,兼顾快速响应与多步骤推理。
【性能表现】在Artificial Analysis Intelligence Index评价体系中,Ling-3.0-tiny综合得分达25分,仅比Gemma-4-26B-A4B低1分,同时高于gpt-oss-120B(high)、Qwen3.5-9B、Gemma-4-12B与Gemma-4-E4B。其Agentic Index得分达16,超过Gemma-4-31B。在FP8精度下,模型在DGX Spark上的推理吞吐量可达100–105 tokens/s,M4 Pro MacBook上达86–90 tokens/s,输出速度超过160 tokens/s,8K上下文峰值内存占用仅8.34GiB,可全本地运行如Infinite Wiki类交互式百科Demo,首Token响应低于100毫秒。
【生态与意义】Ling-3.0-tiny的HF仓库已在Hugging Face与ModelScope同步发布(inclusionAI组织),与8月8日开源的Ling-3.0-flash(124B总参数/5.1B激活参数)形成完整百灵模型矩阵——前者面向端侧与边缘,后者面向云端高吞吐。模型首次将Kimi的KDA与DeepSeek的MLA在同一架构中融合,被业内视为国产开源大模型协同创新的标志性案例,体现出在DeepSeek-V3架构被广泛借鉴后中国AI实验室之间的技术互通趋势。
【总结】蚂蚁百灵以Ling-3.0-tiny切入轻量级开源市场,1.3B激活参数跑出26B级模型综合能力,叠加原生混合推理与Kimi/DeepSeek双架构融合,重新定义了本地端侧大模型的部署门槛。
【参考来源】
1. 智东西:https://zhidx.com/p/583981.html
2. 腾讯新闻:https://news.qq.com/rain/a/20260811A0BT2C00
3. 凤凰网:https://tech.ifeng.com/c/8vVTfxTA8Kz
4. 凤凰网汽车:https://auto.ifeng.com/c/8vVX3RyePk5
5. 界面新闻:https://www.jiemian.com/article/14907148.html
6. Hugging Face:https://huggingface.co/inclusionAI/Ling-3.0-tiny
7. ModelScope:https://modelscope.cn/models/inclusionAI/Ling-3.0-tiny
8. IT之家(关联Ling-3.0-flash):https://www.ithome.com/0/987/231.htm









