vLLM 0.28.0 今日发布

vLLM是一款开源的大语言模型高吞吐量推理与服务引擎,专注于在有限硬件资源下实现尽可能高的模型吞吐量和低延迟推理

LLM大模型 部分免费

vLLM是一款开源的大语言模型高吞吐量推理与服务引擎,专注于在有限硬件资源下实现尽可能高的模型吞吐量和低延迟推理。2026年8月29日,vLLM正式发布v0.28.0版本,这是该项目历史上规模最大的更新之一,由全球270位贡献者(其中76位为新贡献者)共同完成584次代码合并。vLLM 0.28.0的核心更新方向集中在三大领域:对国产前沿模型(尤其是Kimi-K3和DeepSeek V4)的深度性能优化、推测解码技术升级,以及Model Runner V2架构的成熟化落地。

在Kimi-K3优化方面,v0.28.0引入了多项底层技术创新:新增Decode Context Parallel(DCP)并行支持,使模型能够更高效地利用多卡并行处理长序列;融合FlashKDA decode与prefill kernel,在内核层面实现1.5到3倍加速;引入SiTU激活函数支持以适配MegaMoE架构;采用GEMM-RS序列并行策略,通过组合all-gather操作进一步提升计算效率;新增自适应推测Token预算机制,使DSpark首Token时延降低约60%;还支持可选的shared-expert分片,每张GPU可节省约17 GiB显存占用。此外,Kimi-K3首次实现了在AMD ROCm平台上借助V2 model runner运行,标志着vLLM对国产硬件生态的支持进一步深化。

在DeepSeek V4支持方面,稀疏MLA(Multi-head Latent Attention)首次实现端到端完整流程覆盖,支持普通decode、MTP(Multi-Token Prediction)和DSpark推测解码全链路;新增AMD Quark NVFP4量化支持、reasoning-effort提示词映射、稀疏top-k元数据kernel优化,并对eager CUDA graph区域进行了缩窄优化,同时在AMD ROCm的gfx11和gfx950架构上完成启用。推测解码方面引入了DFlash2(本地卷积+候选选择器)和DSpark置信度调度验证,并对草稿模型默认开启异步调度机制。

vLLM 0.28.0还正式引入了Model Runner V2这一新架构,包含Encoder/Prefill/Decode(E/P/D)三阶段分离解耦、权重卸载、多层MTP KV cache、encoder CUDA graphs、decoder token级池化等关键特性,使得异构硬件部署和弹性扩缩容成为可能。vLLM通过PagedAttention技术实现显存的高效利用,配合连续批处理(continuous batching)最大化GPU利用率,同时提供与OpenAI API完全兼容的接口,可实现零代码迁移的模型切换。作为UC Berkeley支持的开源社区项目,vLLM已成为大模型推理部署领域的事实标准。

团队信息

由 AI 猎手自动发现

评论与建议

0 条评论