LLM 推理用扩散模型比自回归快四倍——Google 这个开源模型把文本生成彻底换了条路
传统 LLM 用自回归生成:一个 token 一个 token 往外吐,每步都要等前一步完成,大上下文时延迟明显。
Google DeepMind 6 月 11 日发布的 DiffusionGemma 把这件事换了条路。
扩散模型怎么生成文本?
把 token 序列看作「图像」:前向扩散给句子加噪声,逆向去噪逐步还原。大致流程:
- 前向过程:真实文本逐步加入高斯噪声,最终变成完全随机
- 逆向过程:模型学习从噪声中恢复原始文本,一次预测多个 token 的去噪方向
- 多步迭代:通常 10-20 步去噪后得到完整文本
图像生成领域的 DDPM(DDPM / Stable Diffusion)就是这个思路,DiffusionGemma 把相同的逻辑搬到了文本上。
性能数据
- H100 GPU:1100 token/s
- RTX 5090:700 token/s
- 同规模自回归模型(如 Gemma 4 同等参数):约 250-300 token/s
四倍速度,代价是每次生成需要 10-20 步去噪迭代,每步本身也要计算,所以「四倍」是端到端延迟的提升,而不是单步变快。
什么场景适合扩散模型?
优势场景:内容创作、长文摘要、多风格写作、对话生成——这些场景「质量优先于顺序」,扩散模型可以同时考虑前后 token 的依赖关系,生成结果更流畅。
劣势场景:精确逐 token 输出的任务(代码生成、数学推导、格式化输出)——扩散模型的「一步对多个位置去噪」在需要精确控制每个 token 的场景反而不如自回归。
工程落地
DiffusionGemma 权重已开源,HuggingFace 可直接下载。推理框架推荐用 vLLM 或 Transformers,支持自定义扩散推理 pipeline。对于需要低延迟的生产环境,可以用 10 步去噪(速度优先)或 20 步(质量优先)来平衡。
对 AI 编程的意义
代码生成是典型的「精确逐 token」任务,扩散模型目前不占优势。但在代码评审、文档生成、测试用例生成等「偏创作」的场景,扩散模型的并行生成优势会更明显。随着技术演进,代码生成早晚也会受益——但目前阶段,自回归模型仍是 coding agent 的主力。
Google 把这个方向开源,意义在于让社区探索「扩散+文本」的边界,而不是替代现有的自回归路线。两类模型会长期共存,各自在适合的场景发力。
评论区
登录后可评论。