时间:2026 年 8 月 12 日
地点:美国马萨诸塞州剑桥(Liquid AI 总部),Hugging Face 平台全球同步上线
人物:Liquid AI 工程团队(孵化自 MIT 的 Ramin Hasani 团队)
事件详情:人工智能初创公司 Liquid AI 正式发布并开源 LFM2.5-VL-3B 视觉语言模型(VLM),这是其迄今最强大的端侧多模态模型。模型总参数 3.1B,采用 Google SigLIP2 400M NaFlex 视觉编码器与自家 LFM2.5-2.6B 文本 backbone,预训练数据约 34 万亿 tokens(视觉数据量为上代的 4 倍),词表扩展至 128K 以更好支持非拉丁脚本。Liquid AI 称其在 28 项视觉基准测试平均 69.4 分,相比上代 LFM2-VL-3B 的 57.2 提升 12 点,仅落后 4.7B 参数的 Qwen3.5-4B 约 0.7 分。
背景:Liquid AI 由前 MIT 教授 Ramin Hasani 等创立,专注端侧 AI 模型架构创新。此前 8 月 4 日刚发布纯文本版 LFM2.5-2.6B,本次 VL 版本延续"非推理(non-reasoning)"设计——直接回答不生成思维链——以保持实时端侧所需的低延迟。模型训练流程包括监督微调(SFT)+ Antidoom 训练 + 多奖励强化学习(RL)。
影响:四大能力同步升级。屏幕/UI 理解上,ScreenSpot-v2 平均 80.7(从单位数跃升),远超 8B 的 Gemma-4-E4B(50.9);物体定位 RefCOCO 从 57.1 跃至 87.9,Liquid AI 归因于规模化合成 grounding 数据;工具调用 ToolSandbox 从 26.4 翻倍至 59.5,与 Gemma-4-E2B 持平;多图推理 BLINK 从 50.2 升至 61.5、MuirBench 从 34.9 升至 58.3。推理速度方面,Apple M5 Max 端 228 tokens/s、Ryzen AI Max+ 395 端 116 tokens/s、Galaxy S26 Ultra 端 20 tokens/s、显存占用仅约 3 GB,单张 H100 高并发可达 11K tokens/s(约等于每日 10 亿 tokens 产出)。llama.cpp、MLX、vLLM、SGLang、ONNX 首日全部支持,GGUF / ONNX / MLX 量化版本同步发布。
总结:Liquid AI LFM2.5-VL-3B 用 3.1B 参数实现了对 4B 级模型的视觉性能追平(28 项基准仅落后 Qwen3.5-4B 0.7%),同时把"屏幕理解 + 工具调用 + 多图推理 + 物体定位"四大能力一并打包进端侧可跑的体积(约 3 GB 显存、20 tokens/s 手机可跑),是 2026 年端侧多模态 AI 走向实用的标志性发布。
参考来源:
1. Hugging Face 官方博客:https://huggingface.co/blog/LiquidAI/lfm2-5-vl-3b
2. Liquid AI 官方博客:https://www.liquid.ai/blog/lfm2-5-vl-3b
3. Unite.AI 报道:https://www.unite.ai/liquid-ai-ships-lfm2-5-vl-3b-for-faster-vision-language-ai-on-the-edge/
4. Hugging Face 模型卡:https://huggingface.co/LiquidAI/LFM2.5-VL-3B
5. Liquid AI Playground 在线体验:https://playground.liquid.ai/chat?model=LFM2.5-VL-3B
6. Liquid AI 官方文档:https://docs.liquid.ai/lfm/models/lfm25-vl-3b









