26亿参数能在智能手机上跑AI Agent?今天终于把这件事说清楚了——LFM2.5-2.6B把端侧智能体这件事彻底变了

26亿参数能在智能手机上跑AI Agent?今天终于把这件事说清楚了——LFM2.5-2.6B把端侧智能体这件事彻底变了

大模型军备竞赛打到现在,参数规模从千亿一路卷到百亿,业界终于开始认真面对一个最基本的问题:跑得动比跑得快更重要。2026年8月5日,Liquid AI发布的LFM2.5-2.6B开源模型给出了一个新的答案——不是靠更大的参数堆出来的性能,而是用更聪明的架构,让26亿参数的模型在智能体任务上打平了Qwen3.5-9B。

这个数字放在两年前是不可想象的。一款比Gemma-4-9B小3.5倍、比Qwen3.5-9B小将近4倍的模型,怎么做到的?答案藏在架构里。

液体神经网络:小参数也能大聪明

LFM2.5系列的核心不是Transformer,而是液体神经网络(Liquid Neural Networks)和状态空间模型(State-Space Models)的混合架构。这套架构的核心逻辑和Transformer完全不同——Transformer需要把所有知识压缩进参数,而液体神经网络擅长用更少的参数建模更长的上下文依赖。

翻译成人话就是:别人记东西是用笔记本,你用的是思维导图。参数少,但连得快。

在34T Token的大规模预训练数据支撑下,LFM2.5-2.6B的基准测试结果让业界重新审视了「参数规模」和「智能能力」之间的关系。在指令执行(instruction following)和工具使用(tool-use)两个智能体核心能力维度上,LFM2.5-2.6B在所有测试中均优于Gemma-4-2B-IT和Gemma-4-4B-IT,几乎所有工具使用测试均领先对手。只有在BFCLv4测试中落后于Qwen3.5-9B——而Qwen3.5-9B的参数量是它的3.5倍。

不是所有场景都赢了,但赢的才是关键场景

在STEM领域,LFM2.5-2.6B在AA Omniscience评测中领先,在数学测试中落后于Qwen3.5-9B——这部分是更大参数模型传统优势区,不意外。编程是唯一一个更大模型仍保持明显优势的领域,9B模型在代码生成和理解上的积累深度目前还难以被小模型全面超越。

但注意这里的关键词是「智能体任务」——指令执行、工具调用、多步骤推理。这些才是移动端和边缘设备真正需要的能力,而不是跑个数学证明或者写一段长代码。你在手机上要AI帮你订餐厅、查日程、控制IoT设备,需要的不是「大语言能力」,是「把一件事快速正确地做完」的能力。

为什么这件事值得关注

过去一年,端侧AI模型的叙事逻辑一直是「参数越来越小、能力越来越强」,但实际落地情况是:大多数端侧模型跑得动的都是对话类应用,真正能执行多步骤智能体工作流的模型,参数基本都在7B以上,手机上基本是「能装但跑不动」的状态。

LFM2.5-2.6B把这个边界往前推了一步。26亿参数意味着什么?意味着它可以被装进iPhone 15 Pro的神经网络引擎里,以合理的速度跑本地推理,不会把电吃完,也不会热到烫手。

支持主流推理引擎,落地门槛不高

Liquid AI同时在Hugging Face提供了基础版和后训练版,并支持Llama.cpp、MLX、ONNX、CoreML、SGLang、vLLM等主流推理运行时。这意味着你不需要重新训练或者量化压缩,直接可以用现有的部署工具把它跑在手机或者边缘设备上。CoreML支持让iOS开发者可以用Apple的原生框架直接集成,MLX支持则覆盖了Apple Silicon Mac全系列。

下一步:选对场景比选对模型更重要

如果你在做需要端侧AI的应用,参考这个决策路径:先问自己「我的用户主要在什么设备上用」,再问「他们需要AI干什么」。如果目标是智能体类任务——多步骤工具调用、实时语音助手、IoT设备控制——LFM2.5-2.6B是一个值得测试的选项,尤其在iPhone和Mac生态内,CoreML的硬件加速会给出不错的推理速度。如果你的场景是复杂代码生成、长文档分析、深度推理,9B以上的模型仍然是更稳妥的选择,端侧跑不动就上API,没有必要在错误的场景里硬省成本。

模型已经在Hugging Face开源,可以直接下载测试。部署门槛比半年前又低了一截——但选择门槛没有降低,选对场景永远比选贵或者选新更重要。

评论区

0 条评论

登录后可评论。

AI 论文日报 996 阅读