时间:2026年8月9日
地点:美国加州山景城(Google DeepMind)
人物:Google DeepMind DiffusionGemma 团队(Adrien Ali Taïga、James Assiene、Daniele Calandriello 等)
【事件详情】
Google DeepMind 于8月9日正式发布 DiffusionGemma 技术报告(arXiv:2608.00146),披露其文本扩散语言模型的完整训练细节与基准表现。报告核心结论是:构建文本扩散模型无需从零训练——团队以已有的 Gemma 4-26B-A4B(混合专家模型)为起点,仅用不到原模型 10% 的训练 token 预算,通过两阶段后训练即转化为高性能扩散模型。
第一阶段为文本重建学习,模型从示例数据中学会从被噪声污染的文本块还原完整内容;第二阶段被命名为 SD·RL,将强化学习(提升回答质量)与采样器蒸馏(减少推理计算步数)合并为单一流程。Google 表示,这种组合方法使推理基准分数平均提升约 10 分,同时每计算步的 token 处理量提升近 4 倍,答案长度比 Gemma 4 短约 50%,进一步放大速度优势。
【技术亮点】
- 输出速度最高可达约 1,500 tokens/秒,是 Gemma 4 的 4 倍
- 双向推理机制:可在生成过程中自我修正早期错误,而非像自回归模型那样先输出错误再补正
- 数独解题准确率从 Gemma 4 的接近 0% 提升到约 85%
- 结构化输出(JSON、代码修复)仅需 2-3 轮去噪迭代即可完成
- 仍保留逐字生成文本能力,可在两种模式间按任务切换
【背景】
DiffusionGemma 模型本身已于 6 月 10 日以 Apache 2.0 许可证开源,权重可在 Hugging Face 与 Kaggle Models 下载,并获得 NVIDIA RTX GPU 加速优化。本次技术报告则系统披露了训练方法学、性能权衡与失败模式。Gemma 4 系列是 Google 于 2026 年 4 月推出的开源大模型家族,基于与 Gemini 3 相同的研究体系构建,覆盖从边缘设备到数据中心的多种规格。
【局限】
- 整体输出质量仍略低于同规格的 Gemma 4 自回归模型
- 因计算步数大幅缩减,模型偶尔陷入重复循环
- 多模态任务中推理段未能正确闭合,会人为拉低基准分数
- 速度优势主要体现在单用户场景,约 32 路并发时吞吐量优势消失
【影响】
- 证明现成自回归大模型可低成本"改造"为扩散模型,大幅降低文本扩散研究的入门门槛
- 为低延迟本地工作流、边缘部署、代码与结构化数据修复等场景提供新选项
- 强化学习与采样器蒸馏的合并训练思路(SD·RL)有望启发后续扩散模型研究
- 双向推理范式或挑战自回归 LLM 在数独、约束满足类问题上的传统主导地位
【总结】
DiffusionGemma 技术报告把 6 月份"4 倍提速"的发布从营销叙事升级为可复现的工程细节:以 Gemma 4 为基础,仅用约 10% 算力即可获得 1,500 tokens/秒的扩散语言模型,并在数独解题、JSON 与代码修复等结构化任务上验证了双向推理的实用价值。Google 明确将其定位为面向研究者与开发者的实验性模型,生产环境仍建议使用 Gemma 4,但报告为整个文本扩散赛道打开了一条"站在巨人肩膀上"的捷径。
【参考来源】
- https://the-decoder.com/googles-diffusiongemma-proves-you-dont-need-to-train-from-scratch-to-build-a-text-diffusion-model/
- https://arxiv.org/abs/2608.00146
- https://blogs.nvidia.com/blog/thin-light-nvidia-studio-systems/
- https://www.kaggle.com/models/google/diffusion-gemma
- https://so.html5.qq.com/page/real/search_news?docid=70000021_8086a29eeb434952
- https://so.html5.qq.com/page/real/search_news?docid=70000021_2856a2ae98094852









