Pipette

端侧AI性能基准测试套件,让模型在手机和电脑上的真实表现可衡量、可复现

AI编程开发 部分免费

Pipette 是由 Liquid AI 联合独立基准机构 Artificial Analysis 于 2026 年 8 月正式开源的端侧 AI 部署配置基准测试套件。其核心设计理念是:端侧 AI 的行为是整个部署系统的属性,而非孤立模型的属性。传统模型卡片在服务器级、全精度条件下给出的能力评分,无法预测同一模型被量化后跑在手机上的真实表现——Pipette 正是为解决这一问题而生。Pipette 将模型、量化格式、运行时、设备作为单一测量单元,覆盖 30 以上的模型、多种量化格式(Q4_K_M、INT4 等)、llama.cpp 在 macOS、iOS、Windows、Android 上的构建版本,以及 256 至 8,192 token 的上下文长度,共产生超过 1,000 组经实验室验证的配置数据。每组配置测量五项核心端侧性能指标:首 token 时间、端到端延迟、prefill 吞吐量、decode 吞吐量和峰值内存占用。质量评估(IFBench、GPQA Diamond、MATH-500)在 NVIDIA H100 80GB 参考系统上运行,与端侧性能数据通过相同模型和量化配置配对展示。Pipette 以 Apache 2.0 协议全栈开源,包含 pipette-mgmt(基准定义管理)、pipette-clients(设备端基准执行)、pipette-scores(评分聚合)三个核心模块,配套公开数据集、托管仪表盘以及原生 iOS 和 Android 基准 App,社区提交功能处于 Beta 阶段。初始验证设备包括 MacBook Pro M5 Max、iPhone 17 Pro 和 Galaxy S26 Ultra,AMD Ryzen AI Max+ 395 与 Radeon 8060S 结果即将上线。该套件的应用场景覆盖消费电子 OEM、汽车、机器人、医疗设备、金融和国防等行业,帮助团队在模型选型、SoC 采购、运行时回归测试和上下文容量规划等环节做出有数据支撑的决策。例如,在 Galaxy S26 Ultra 上,Q4_K_M 量化下 Granite-4.0-H-350M 与 Granite-4.0-350M 参数规模相同、量化相同、硬件相同,但在 4,096 token 输入时 decode 吞吐量保留率分别为 78.4% 和 33.8%——这种差异只有在完整部署配置下才能被发现。Pipette 将此类隐藏的权衡第一次摆到了实验台桌面上。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论