时间:2026年8月24日(北美)发布,全球开源社区同步上线
地点:美国马萨诸塞州剑桥(Liquid AI 总部),数据由 Artificial Analysis 独立方法论验证
人物:Liquid AI CEO 兼联合创始人 Ramin Hasani;Artificial Analysis 移动设备基准团队;模型厂商、OEM、芯片厂商、手机厂商开发者
事件详情:Liquid AI 联合独立基准机构 Artificial Analysis,于 8 月 24 日正式开源端侧 AI 部署配置基准测试套件 Pipette。该套件把"模型 + 量化 + 运行时 + 设备"作为单一测量单元,覆盖 30+ 模型、多种量化格式、llama.cpp 在 macOS/iOS/Windows/Android 上的构建,以及 256 至 8,192 token 的上下文长度,共计 1,000+ 经过实验室验证的配置。性能测量包含五项核心指标:首 token 时间、端到端时延、prefill 吞吐、decode 吞吐和峰值内存;质量评估(IFBench/GPQA Diamond/MATH-500)则在 NVIDIA H100 80GB 参考系统上跑 llama.cpp,与同模型同量化的端侧结果配对显示。整套基础设施以 Apache 2.0 协议开源,包含 pipette-mgmt、pipette-clients、pipette-scores 三个核心模块,以及公开仪表盘、iOS 和 Android 原生基准 App,无任何等待名单,社区提交结果功能处于 beta 阶段。初始验证设备为 MacBook Pro M5 Max、iPhone 17 Pro 与 Galaxy S26 Ultra,AMD Ryzen AI Max+ 395 与 Radeon 8060S 结果将在后续加入。
背景:当前主流大模型的"模型卡"普遍以服务器级、全精度条件下的能力评测为主,几乎无法预测同一模型被量化、装入特定运行时之后在手机或笔记本上的真实表现。量化方式、运行时版本、操作系统、设备散热、内存压力、上下文长度共同决定端侧体验,单看参数规模和榜单分数容易误判。端侧 LLM 的可重复测量、跨厂商可比、跨设备一致的基准长期缺位。
影响:Pipette 的发布把"端侧 AI 性能评估"从厂商自报的 PPT 数字,转为开源、可复现的实验室数据集。具体数据点已显示出"配置"而非"参数"才是端侧选型的关键——在 Galaxy S26 Ultra、Q4_K_M 量化下,Granite-4.0-H-350M 与 Granite-4.0-350M 参数量相同、量化相同、硬件相同,但 256→4,096 token 的 decode 吞吐保留率分别为 78.4% 与 33.8%,差距悬殊;Liquid 自家 LFM2.5-8B-A1B 凭借稀疏激活在 2,048 token 输入时比 Qwen3.5-4B 快 2.4 倍,但峰值内存仍达 5.29 GiB;速度与质量也常常错位,iPhone 17 Pro 上 MiniCPM5-1B 比 LFM2.5-1.2B-Instruct 快 15.8%,后者却在 MATH-500 上高 9.0 分。这套基准直接服务手机 OEM、汽车、机器人、医疗设备、金融、国防等需把推理留在本地的行业,帮助团队在选型、SoC 采购、运行时回归测试、上下文容量规划等环节做出实证决策。
总结:Liquid AI 把端侧 AI 的能力评估从单模型分数转为完整部署配置的可复现测量,联合 Artificial Analysis 做独立验证、Apache 2.0 全栈开源,并配套公开仪表盘和原生移动端 App,把"模型卡分数好看但手机拉胯"的行业问题第一次摆到实验室台面上。
参考来源:
1. https://www.liquid.ai/blog/pipette-on-device-ai-benchmarking-by-liquid-ai (Liquid AI 官方博客)
2. https://www.marktechpost.com/2026/08/25/liquid-ai-open-sources-pipette-a-reproducible-benchmarking-suite-that-measures-on-device-models-quantization-runtime-and-hardware-together/ (MarkTechPost 首发报道)
3. http://artificialanalysis.ai/articles/mobile-phone-intelligence-inference (Artificial Analysis 独立方法论验证)
4. https://alphasignal.ai/news/liquid-ai-s-pipette-exposes-what-server-benchmarks-hide-about-phone-ai (AlphaSignal 技术解析)
5. https://www.siliconsnark.com/liquid-ai-launches-pipette-because-on-device-ai-benchmarks-need-adult-supervision (SiliconSnark 评论)
6. https://explainx.ai/blog/liquid-ai-pipette-on-device-benchmark-august-2026 (ExplainX 解读)
7. https://kiadev.net/news/2026-08-25-pipette-on-device-ai-benchmarking (KiaDev 解读)
8. https://lumienai.com/news/liquid-ai-pipette-on-device-benchmarking-suite (Lumienai 实测指南)
9. https://pipette.liquid.ai/docs/introduction (Pipette 官方文档)
10. https://github.com/Liquid4All/pipette-mgmt (GitHub 开源仓库)









