**时间**:2026年8月20日(美国东部时间)
**地点**:美国马萨诸塞州波士顿(Liquid AI 总部)
**人物**:Liquid AI 研发团队;LFM2.5 模型系列作者
**事件详情**:
2026年8月20日,Liquid AI 正式发布 LFM2.5-DSpark 系列草稿模型,将推测解码(speculative decoding)技术首次规模化落地到 LFM2.5 全家族,覆盖 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 三款目标模型。
核心性能数据为:H100 GPU(BF16)单卡推理吞吐量提升最高 3.18 倍,M4 Max MacBook 端侧推理提升最高 2.87 倍,LFM2.5-2.6B 工具调用延迟平均降低 57%;每个草稿模型约 300M 参数,由 5 层 attention-only 构成的解码器 + 隐藏状态投影 + Markov 头组成,单次解码 9 个候选 token 块。
权重以 Safetensors 与 GGUF 双格式发布,Day-One 同步支持 llama.cpp(PR #27383)和 SGLang(PR #31041),两家推理框架均已上游合并。
**背景**:
DSpark 由 DeepSeek 研究员在 2026 年 7 月公开(论文 arXiv:2607.05147),并已落地到 DeepSeek-V4 线上推理系统。技术上是 DFlash 风格并行主干 + 轻量 Markov 序列头 + 置信度调度验证器三大组件的组合,并行主干为目标模型上下文生成所有草稿 token 隐藏状态,Markov 头建模相邻 token 依赖抬升接受率,置信度调度验证器则剪枝低置信后缀避免负优化。
Liquid AI 在 GitHub 公开其参考实现,采用与 SGLang 同步的简化 attention-only 设计,并以 15 轮 SFT+chat+code+function-calling 混合数据训练,按"接受率最高"而非"loss 最低"选取最优 epoch。
**影响**:
- 端侧 agent 推理成本结构性下降,MacBook 上的 LFM2.5-2.6B 工具调用场景从实验演示走向生产可用;
- 推测解码从"专有加速"变成"开源标配",与 EAGLE-3、DFlash 形成三大开源派系;
- Apple Silicon 端侧部署生态受益,DSpark 官方实验全程使用 Metal 内核;
- 为 Liquid AI 8B-A1B MoE 走向端侧打开通道,DSpark 在 MATH500 跑出 428→1362 tokens/s 的 3.18 倍峰值。
**总结**:
LFM2.5-DSpark 是 Liquid AI 在 LFM2.5 基础模型之上的"加速器"——用 ~300M 参数增量换取最高 3.18 倍解码速度,且输出与目标模型完全一致(greedy decoding 验证),对端侧 agent 与长输出场景尤为关键。
**参考来源**:
- https://huggingface.co/blog/LiquidAI/lfm25-dspark
- https://www.unite.ai/liquid-ai-ships-lfm2-5-dspark-for-up-to-3-2x-faster-inference/
- https://www.marktechpost.com/2026/08/20/liquid-ai-releases-lfm2-5-dspark-draft-models-that-deliver-up-to-3-18x-faster-decoding/
- https://github.com/ggml-org/llama.cpp/pull/27383
- https://github.com/sgl-project/sglang/pull/31041
- https://huggingface.co/LiquidAI/LFM2.5-2.6B-DSpark
- https://huggingface.co/papers/2607.05147









