蚂蚁百灵Ling 3.0 124B参数对标旗舰

时间:2026年7月24日 地点:杭州(中国) 人物:蚂蚁集团百灵大模型团队 事件详情: 2026年7月24日,蚂蚁集团旗下百灵大模型正式发布百灵新一代原生混合推理模型 Ling-3.0-flash。该模型总参数量为124B(约为上一代Ring-2.6-1T旗舰的12.4%),激活参数量仅为5.1B(约为上一代旗舰的8.1%),却实现了全方位的能力对标甚至超越。Ling-3.0-flash采用原生混合线性注意力架构(5:1交替堆叠KDA与MLA),并升级全新KDA细粒度对角门控与1/64稀疏MoE。模型同时接入SGLang HiCache+Mooncake分级缓存架构,长输入下TTFT降低60%至80%以上。OpenRouter和百灵官方平台同步开放限时免费API(截止8月3日23:00北京时间),免费期结束后正式开源。 背景: 百灵大模型是蚂蚁集团自2025年起推出的自研大模型系列,已先后发布Ling-Lite、Ling-Plus、Ling-flash-2.0、Ling-2.6-flash、Ling-2.6-1T等多款开源模型,构建起覆盖百亿到万亿参数规模的开源生态。其中Ring-2.6-1T是百灵于2026年4月开源的旗舰思考模型,定位为全栈国产化路径和工程化能力的代表作。本次发布的Ling-3.0-flash将激活参数从1T级压降至5.1B,同时保持上一代旗舰能力,意味着大模型从「参数堆叠」向「高智效比」的工程范式转变。原生混合推理架构的引入,让推理、思考、生成可在单一模型中无损切换。 影响: - 大模型从「参数堆叠」向「高智效比」加速演进——5.1B激活参数即可比肩1T上一代旗舰,验证了原生混合线性架构和稀疏MoE的工程价值,为后续大模型迭代树立新基准。 - 蚂蚁集团在开源大模型生态的版图进一步扩大——Ling-3.0-flash限时免费API叠加后续开源策略,配合OpenRouter、ZenMux、魔搭社区、Hugging Face等多元分发渠道,对DeepSeek、Kimi、智谱、字节豆包等竞品形成正面竞争压力。 - 企业级AI Agent落地成本与延迟有望进一步降低——HiCache+Mooncake双池架构使长程交互无需重算,TTFT降低60%-80%,对Coding、Deep Research等长上下文场景尤为关键,Agent任务全程闭环能力显著增强。 总结: Ling-3.0-flash是蚂蚁百灵大模型首次发布原生混合推理架构的产品,以124B总参、5.1B激活的「小激活」实现1T级上一代旗舰的能力对标甚至超越,标志着国产大模型在「以智效比换性能」路线上的关键进展。结合限时免费API与正式开源策略,蚂蚁集团正在通过开放生态抢占国内大模型市场份额,与阿里通义Qwen3.5、DeepSeek、Kimi、智谱等形成正面竞争。在开源策略与多元分发渠道并行下,国产大模型从「参数规模竞赛」向「效率与智能密度」并重的工程范式正在加速形成。 参考来源: - https://www.ithome.com/0/981/382.htm - https://openrouter.ai/inclusionai/ling-3.0-flash:free - https://huggingface.co/inclusionAI - https://modelscope.cn/models/inclusionAI/Ling-3.0-flash - https://github.com/inclusionAI - https://zenmux.ai/