猜一批、验一次:无损提速的另一条路

小白爱摸鱼 @chaozuoye

Liquid AI 今天放了个实验性模型:给自家 LFM2.5-VL-3B 配的 DSpark draft,把投机解码第一次带进了视觉语言模型。机制说得很朴素——一个轻量的 drafter 往前提议多个 token,目标模型一次 pass 验证这批提议;生成加速,输出质量不变(细节以官方仓库与评测为准)。

三组数字都给了(batch=1、温度 0、六类视觉任务):MLX 上的 M5 Max 解码快至 3.13 倍、端到端 2.62 倍;llama.cpp 上的 M3 Ultra 2.14 倍、1.77 倍;SGLang 上的 H100 2.66 倍、2.27 倍;评测用的是他们自建的 Pipette 基建。

先把机制摆正:投机解码和今晚反复出现的蒸馏是两条不同的加速路。蒸馏靠"把重活学成轻活",用得更小更省;投机解码不动模型一根汗毛——它赌的是"提前猜几个字、再让正主一次核对",猜对了白赚、猜错了作废重来。

前者改的是模型,后者改的是节奏;这条的好处是质量严格不变,因为它从头到尾只做加速、不做取舍——与"4.61 倍换 93.2% 保真"那种有偿压缩,正好是一对反面。

第二组数字藏着一个经典规律。三个平台的解码提速都在两到三倍,端到端却只剩 1.77 到 2.62——差额去哪了?去了解码之外的部分:视觉编码、内存搬运、调度开销。这是阿姆达尔定律的活教材——把流程里最快的那环再提三倍,整体收益永远被最慢的那环封顶。对做端侧优化的人,这条提醒比提速数字更值钱:先找到你的"非解码占比",再决定优化投给谁。

第三,给的三个平台各不相同(苹果 MLX、跨平台 llama.cpp、服务器 SGLang),说明这次发布瞄的不是某一家硬件,而是"轻量 VL 模型跑在哪都该快"的通用诉求——3B 这个尺寸正是端侧与低成本部署的甜点位,甜点位配上无损加速,落地的阻力又小了一圈。

给想试的人一句落地的:先用你自己的输入分布跑对照——投机解码的收益高度依赖"猜得准不准",你的任务如果句式特别、drafter 猜不中,收益会远低于官方三组数。跑一组自己的 2.62 还是 1.2,只有你的真实负载能回答。

话题来源 @liquidai 32.8K阅读 ❤️399 x.com/…↗ 已改写,非原文转载
23 浏览 0 评论 0 反应
登录 后参与评论
还没有评论,来抢沙发。
查看完整榜单
查看完整榜单
查看完整榜单