热门AI工具推荐

AI编程订阅服务,支持多款国产主流编程模型自由切换。
Seedance 2.0AI视频生成
具备卓越的物理真实性和角色一致性,可生成电影级视频内容。
方舟 Agent PlanAI智能体订阅
火山引擎推出的全场景AI智能体订阅服务,通过一个订阅整合5大主流模型和10+AI工具
StepClaw阶跃AI桌面伙伴龙虾Agent智能体
StepClaw是阶跃星辰推出的本地和云端的AI龙虾助手,通过一键部署让普通用户也能拥有7×24小时在线、可自主执行任务的AI数字工作伙伴。
基于OpenClaw架构打造的AI助手平台,核心优势包括云端一键部署、沙箱隔离安全运行、全面接入企业微信/钉钉/飞书三大主流IM工具
SpeedAIAI内容检测降重
AI内容检测与降重工具,能有效帮助用户通过论文AI率检测
墨刀AIAI原型设计平台
墨刀AI是一款能通过一句话描述或图片,快速生成可交互原型、PRD文档及各类图表的一站式智能产品设计协作平台。
秒哒AI工具
不懂代码也能开发应用?百度秒哒:无需编程,快速搭建小程序与网站
有戏AIAI漫剧生成工具
全流程AI短剧创作工具,实现从剧本到成片的自动化生产,让“一人即剧组”成为现实。
沁言学术智能科研平台
一站式文献管理与科研写作工具,支持边写作边搜索文献,高效阅读,文献管理,

vLLM 0.28.0发布 Kimi-K3性能暴涨

vLLM开源推理框架于2026年8月29日正式发布v0.28.0版本。 发布地点为GitHub项目仓库vllm-project/vllm,由社区270位贡献者(其中76位为新贡献者)共同完成584次代码合并。 项目负责人vLLM核心维护团队在Release Notes中确认,本版本是vLLM史上规模最大的更新之一,重点针对Kimi-K3、DeepSeek V4等国产前沿模型做深度性能优化。 Kimi-K3性能突破方面:vLLM v0.28.0新增Decode Context Parallel(DCP)支持,新增融合FlashKDA decode与prefill kernel,新增SiTU激活支持MegaMoE架构,引入GEMM-RS序列并行策略,组合all-gather实现kernel级1.5到3倍加速,新增自适应推测token预算使DSpark首token时延降低约60%,新增可选shared-expert分片每张GPU节省约17 GiB显存。同时Kimi-K3首次支持在AMD ROCm平台借助V2模型runner运行。 DeepSeek V4支持方面:稀疏MLA注意力首次实现端到端,覆盖普通decode、MTP、DSpark推测解码全流程;新增AMD Quark NVFP4量化支持;新增reasoning-effort提示词与映射;新增稀疏top-k元数据kernel优化;缩窄eager CUDA graph区域;并在AMD ROCm的gfx11与gfx950架构上完成启用。 推测解码方面引入DFlash2(本地卷积+候选选择器)、DSpark置信度调度验证,并对草稿模型默认开启异步调度;Model Runner V2走向成熟,新增E/P/D解耦、权重卸载、多层MTP KV cache、encoder CUDA graph、decoder token级池化及Transformers池化模型、无注意力模型与thinking_token_budget支持。 存储与前端方面新增分层KV cache卸载(支持磁盘卸载与out-of-tree二级tier管理器)、Rust前端与gRPC(独立渲染器、多模态gRPC推理、显式数据并行rank路由、RL生命周期控制,protobuf schema已发布至Buf);默认参数方面max_num_batched_tokens从8192提升至16384,Mamba模型默认启用前缀缓存,Blackwell CUDA graph捕获上限提升至1024。 新模型支持包括Muse Glimmer、Ling 3.0 Flash(BF16/MTP/parser及FP8变体,支持hybrid MXFP4 routed experts)、Dots3 NOTE原生多模态以及Interns2mobius;Qwen方面Qwen3.8在AMD ROCm上启用,新增融合CUDA post-conv MTP decode kernel并修正文本checkpoint问题。 需要关注的破坏性变更:bitsandbytes支持迁移为out-of-tree插件;Transformers升级至5.15.0;废弃的calculate_kv_scales运行时KV scale计算被移除;override_attention_dtype被移除。 参考来源: 1. GitHub vLLM v0.28.0 Release Notes: https://github.com/vllm-project/vllm/releases/tag/v0.28.0 2. AIFOD 报道 vLLM 0.28.0 Released: https://af.net/realtime/vllm-0-28-0-released-major-enhancements-in-ai-model-inference-and-serving/ 3. Hacker News 24h 榜单条目: https://news.ycombinator.com/ 4. PyTorch Conference vLLM Sessions 公告: https://pytorch.org/blog/vllm-sessions-at-pytorch-conference-north-america-2026/ 5. RunPod Speculative Decoding Guide: https://www.runpod.io/articles/guides/speculative-decoding 6. SemiAnalysis AgentX InferenceXv3 简报: https://newsletter.semianalysis.com/p/agentx-inferencexv3-does-cuda-moat 7. Tencent Hy4-preview GitHub(Kimi-K3/vLLM调用范例): https://github.com/Tencent-Hunyuan/Hy4-preview 8. vLLM 中文站快速开始: https://vllm.hyper.ai/docs/getting-started/quickstart/