Liquid AI LFM2.5-VL-3B

3.1B 参数端侧多模态模型,视觉能力追平 4B 级模型

LLM大模型 部分免费

LFM2.5-VL-3B 是美国 AI 初创公司 Liquid AI(孵化自 MIT Ramin Hasani 团队)于 2026 年 8 月 12 日开源发布的视觉语言模型,总参数 3.1B,采用 Google SigLIP2 400M NaFlex 视觉编码器与自研 LFM2.5-2.6B 文本 backbone。该模型在 28 项视觉基准测试平均得分 69.4,相比上代提升 12 点,仅落后 Qwen3.5-4B 约 0.7 分,以 3B 参数实现了对 4B 级模型的视觉性能追平。核心技术优势包括:屏幕与 UI 理解 ScreenSpot-v2 平均 80.7 分,远超 Gemma-4-E4B;物体定位 RefCOCO 从上代 57.1 跃升至 87.9;工具调用 ToolSandbox 翻倍至 59.5,与 Gemma-4-E2B 持平;多图推理 BLINK 从 50.2 升至 61.5。推理速度方面,Apple M5 Max 端侧可达 228 tokens/s,Galaxy S26 Ultra 手机端约 20 tokens/s,显存占用仅约 3GB。模型延续非推理设计,直接回答不生成思维链,保持实时端侧低延迟。训练数据约 34 万亿 tokens,词表扩展至 128K 以更好支持非拉丁脚本。首发即支持 llama.cpp、MLX、vLLM、SGLang、ONNX 全框架,GGUF / ONNX / MLX 量化版本同步发布。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论