LLM 推理用扩散模型比自回归快四倍——Google 这个开源模型把文本生成彻底换了条路

你还在等大模型一个字一个字往外蹦?Google DeepMind 上个月悄悄发了一个开源模型,让文本生成速度直接跑到 H100 上 1100 token/s——比同级别自回归模型快四倍,内存占用还更低。

这件事有意思的地方不是「跑得快」,而是它用的方法——扩散模型(Diffusion Model)。对,就是那个在图像生成领域把 GAN 和 VAE 全部打趴下的扩散模型,现在 Google 把它搬到了文本生成上。

Google 把这个模型叫 DiffusionGemma,6 月 11 日正式发布,属于实验性开源模型。它背后的思路很简单:传统大语言模型生成文本是一个 token 一个 token 按顺序往外吐,像走路;而扩散模型是一次性对整段文字做「去噪」,像一步到位。图像扩散模型也是这样工作的——从噪声图逐步还原成真实图像,DiffusionGemma 把这个机制搬到了离散 token 序列上。

实测数据最能说明问题。NVIDIA 博客同步发了优化报告:在单张 H100 GPU 上 DiffusionGemma 跑到 1100+ token/s,在消费级 RTX 5090 上跑到 700+ token/s,同级别自回归模型通常只有 200-300 token/s 左右。这个差距在长文本生成场景里感知非常明显——以前生成一篇 2000 字的文章要等十几秒,现在三秒不到。

内存效率是另一个被低估的优势。扩散模型的计算模式对显存更友好,不需要时刻保存巨大的 KV Cache,所以能在显存更小的显卡上跑。NVIDIA 的测试显示,RTX 5090 这种消费级旗舰卡就能跑到 700 token/s 以上,而同级别自回归模型往往要 H100/A100 才能流畅运行。这意味着本地推理的门槛被显著降低了。

当然它不是没有局限。扩散模型在连续信号(图像、音频)上表现成熟,但文本是离散的 token 序列,离散扩散的训练难度比连续扩散高很多。目前 DiffusionGemma 在开放域问答、代码生成等任务上的表现还在验证阶段,Google 把它定位为实验性模型就是这个原因——还不是全面替代自回归模型的时候。

但方向是对的。Anthropic 和 OpenAI 已经在研究 SSM(状态空间模型)等替代架构来突破自回归的顺序生成瓶颈,Google 这次用扩散模型走了一条完全不同的路。本质上都是同一个目标:让 LLM 推理不再被「必须按顺序一个字一个字生成」这个机制卡死。

下一步怎么看?如果你是做端侧 AI 部署的,DiffusionGemma 值得关注——它让消费级显卡跑大模型推理这件事变得更现实了。如果你在研究 LLM 架构,这个方向值得盯紧,离散扩散在文本上的进展可能比 SSM 更快打开局面。

Paper:Google DeepMind DiffusionGemma(arXiv 2026-06,NVIDIA 优化博客 2026-06-10)

相关资料:

  • Google DeepMind 官方发布:DiffusionGemma 开放模型公告(2026-06-11)
  • NVIDIA 博客:DiffusionGemma 在 H100/RTX 5090 上的实测数据(2026-06-10)
  • 技术原理:文本扩散机制(Text Diffusion)vs 自回归生成(Autoregressive)

评论区

0 条评论

登录后可评论。

AI 论文日报 1038 阅读