vLLM开源推理框架于2026年8月29日正式发布v0.28.0版本。
发布地点为GitHub项目仓库vllm-project/vllm,由社区270位贡献者(其中76位为新贡献者)共同完成584次代码合并。
项目负责人vLLM核心维护团队在Release Notes中确认,本版本是vLLM史上规模最大的更新之一,重点针对Kimi-K3、DeepSeek V4等国产前沿模型做深度性能优化。
Kimi-K3性能突破方面:vLLM v0.28.0新增Decode Context Parallel(DCP)支持,新增融合FlashKDA decode与prefill kernel,新增SiTU激活支持MegaMoE架构,引入GEMM-RS序列并行策略,组合all-gather实现kernel级1.5到3倍加速,新增自适应推测token预算使DSpark首token时延降低约60%,新增可选shared-expert分片每张GPU节省约17 GiB显存。同时Kimi-K3首次支持在AMD ROCm平台借助V2模型runner运行。
DeepSeek V4支持方面:稀疏MLA注意力首次实现端到端,覆盖普通decode、MTP、DSpark推测解码全流程;新增AMD Quark NVFP4量化支持;新增reasoning-effort提示词与映射;新增稀疏top-k元数据kernel优化;缩窄eager CUDA graph区域;并在AMD ROCm的gfx11与gfx950架构上完成启用。
推测解码方面引入DFlash2(本地卷积+候选选择器)、DSpark置信度调度验证,并对草稿模型默认开启异步调度;Model Runner V2走向成熟,新增E/P/D解耦、权重卸载、多层MTP KV cache、encoder CUDA graph、decoder token级池化及Transformers池化模型、无注意力模型与thinking_token_budget支持。
存储与前端方面新增分层KV cache卸载(支持磁盘卸载与out-of-tree二级tier管理器)、Rust前端与gRPC(独立渲染器、多模态gRPC推理、显式数据并行rank路由、RL生命周期控制,protobuf schema已发布至Buf);默认参数方面max_num_batched_tokens从8192提升至16384,Mamba模型默认启用前缀缓存,Blackwell CUDA graph捕获上限提升至1024。
新模型支持包括Muse Glimmer、Ling 3.0 Flash(BF16/MTP/parser及FP8变体,支持hybrid MXFP4 routed experts)、Dots3 NOTE原生多模态以及Interns2mobius;Qwen方面Qwen3.8在AMD ROCm上启用,新增融合CUDA post-conv MTP decode kernel并修正文本checkpoint问题。
需要关注的破坏性变更:bitsandbytes支持迁移为out-of-tree插件;Transformers升级至5.15.0;废弃的calculate_kv_scales运行时KV scale计算被移除;override_attention_dtype被移除。
参考来源:
1. GitHub vLLM v0.28.0 Release Notes: https://github.com/vllm-project/vllm/releases/tag/v0.28.0
2. AIFOD 报道 vLLM 0.28.0 Released: https://af.net/realtime/vllm-0-28-0-released-major-enhancements-in-ai-model-inference-and-serving/
3. Hacker News 24h 榜单条目: https://news.ycombinator.com/
4. PyTorch Conference vLLM Sessions 公告: https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/
5. RunPod Speculative Decoding Guide: https://www.runpod.io/articles/guides/speculative-decoding
6. SemiAnalysis AgentX InferenceXv3 简报: https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat
7. Tencent Hy4-preview GitHub(Kimi-K3/vLLM调用范例): https://github.com/Tencent-Hunyuan/Hy4-preview
8. vLLM 中文站快速开始: https://vllm.hyper.ai/docs/getting-started/quickstart/









