Liquid AI LFM2.5-DSpark 今日发布

推测解码草稿模型,H100推理提速最高3.18倍

部分免费

LFM2.5-DSpark是Liquid AI于2026年8月20日发布的推测解码(Speculative Decoding)草稿模型系列,将DeepSeek团队开源的DSpark技术首次规模化落地到LFM2.5全家族,涵盖LFM2.5-1.2B-Instruct、LFM2.5-2.6B和LFM2.5-8B-A1B三款目标模型,是端侧和云端推理加速领域的重大突破。

核心技术创新在于将推测解码与Liquid AI的自研LFM架构深度结合。DSpark技术由DeepSeek研究团队于2026年7月公开发表(论文arXiv:2607.05147),技术核心是大Flash风格并行主干+轻量Markov序列头+置信度调度验证器三大组件的组合。并行主干为目标模型的上下文生成所有草稿token隐藏状态,Markov头建模相邻token依赖以抬升接受率,置信度调度验证器则剪枝低置信后缀以避免负优化。LFM2.5-DSpark在此基础上针对Liquid AI的设备优化架构做了深度适配,实现了从服务器到MacBook的统一性能提升。

在性能表现方面,H100 GPU(BF16)单卡推理吞吐量提升最高3.18倍(实测MATH500基准:428→1362 tok/s),M4 Max MacBook端侧推理提升最高2.87倍(93→112 tok/s),LFM2.5-2.6B工具调用延迟平均降低57%。这意味着在保持输出质量完全一致的前提下,推理成本大幅降低,实时交互场景的可用性显著提升。

在生态支持方面,权重以Safetensors和GGUF双格式发布,Day-One即同步支持llama.cpp(PR #27383)和SGLang(PR #31041)两大主流推理框架。Hugging Face同步上线了三个尺寸的DSpark草稿模型,用户可直接下载部署。所有LFM2.5模型均为开源权重(Open-weight),允许自由下载、微调和部署,是边缘AI推理领域的里程碑式版本。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论