时间:2026年6月11日
地点:美国加利福尼亚州山景城
人物:谷歌DeepMind团队、CEO桑达尔·皮查伊、研究科学家布兰登·奥多诺霍与塞巴斯蒂安·弗莱纳哈格
事件详情:谷歌DeepMind正式发布实验性开源AI模型DiffusionGemma,这是首个将文本扩散架构落地的开源大模型。该模型基于Gemma 4系列和Gemini Diffusion研究成果构建,参数规模达260亿,采用混合专家架构,推理时仅激活38亿参数。模型采用与图像扩散相同的机制,先铺开256个随机占位Token的画布,再经多轮迭代并行去噪一次性生成整段文本,打破GPT、Claude、Gemini等主流大模型沿用多年的逐Token自回归生成逻辑。在单块英伟达H100 GPU上,模型每秒可生成超过1000个Token,DGX Station设备可达2000个Token每秒,消费级RTX 5090显卡也能跑出700 Token以上的速度,相比同规模自回归模型推理速度提升达4倍。
背景:当前主流大语言模型无论是GPT、Claude还是Gemini,底层都采用自回归架构,像打字机一样从左到右逐字生成内容,在云端高并发场景下效率尚可,但在本地单用户运行时GPU和TPU大量算力闲置,形成内存带宽瓶颈。DiffusionGemma借鉴了Stable Diffusion等图像扩散模型的思路,把图片生成领域的并行去噪机制搬到文本生成领域,让GPU的Tensor Core火力全开,把性能瓶颈从内存带宽转移到算力本身,被谷歌团队比喻为从打字机升级为整版印刷的印刷机。
影响:
- 26B参数MoE架构仅激活3.8B参数,经NVFP4量化后仅需18GB显存即可运行,一张RTX 4090消费级显卡就能本地部署,端侧AI推理首次获得接近实时的文本生成体验
- 双向注意力机制使每个Token在生成时能看到段落中所有其他Token,特别适合代码补全、行内编辑、数独解题等需要统筹全局的非线性任务,HumanEval代码生成通过率达89.6%
- 模型采用Apache 2.0开源协议,权重已在Hugging Face、GitHub和vLLM上架,可自由商用和二次分发,英伟达已宣布提供首日支持覆盖RTX GPU和DGX全系列
- 输出质量整体低于标准版Gemma 4,MMLU测试77.6%比同门兄弟低5个百分点,复杂推理和长文本连贯性仍有差距,定位为速度优先的实验性工具而非生产替代
- 在高并发云服务环境下DiffusionGemma的并行优势可能收益递减甚至增加成本,技术分析师卡米·利维认为该模型将催生新一代任务导向的高效AI解决方案,重塑按Token计费的商业模式
总结:DiffusionGemma的发布标志着AI文本生成从串行时代向并行时代迈出了关键一步。这并非要替代Claude Fable 5或GPT-5.5这样的顶级闭源旗舰模型,而是开辟了一条全新的技术路径:把图像生成的扩散机制搬到文本领域,用并行去噪换速度提升。谷歌CEO皮查伊将其比作一匹赛马,意在探索赛道之外的可能性。对于个人开发者和企业而言,这意味着在不依赖云端、保护数据隐私的条件下,首次可以在消费级硬件上获得接近实时的AI文本生成体验,代码补全、本地知识库、实时翻译等场景都将迎来效率变革。同时,文本扩散架构的可行性得到验证后,AI效率竞赛的重心正从更大模型转向更聪明的生成方式,整个行业的技术路线有望迎来多元化发展。
参考来源:
https://news.sina.cn/ai/2026-06-20/detail-inicymqn2546580.d.html
https://m.163.com/dy/article/KVQR499L05118UGF.html
https://k.sina.cn/article_5703921756_153faf05c019046snm.html
https://it.sohu.com/a/1038979352_121956424
https://m.toutiao.com/article/7651511859639517696/
https://blog.csdn.net/techforward/article/details/161946288
https://m.pedaily.cn/news/565172
https://m.elecfans.com/article/7983490.html









