2026-06-11 10:29
谷歌发布DiffusionGemma:尝试用文本扩散架构提速AI推理
文本核心速览
- 文本扩散架构发布—谷歌于6月10日发布实验性开源模型DiffusionGemma,采用文本扩散架构,旨在探索非自回归路径以提升AI生成效率。
- 速度优势达4倍—在专用GPU上,DiffusionGemma的文本生成速度相比传统自回归模型最高提升4倍,但该优势主要存在于本地设备运行和低并发推理场景。
- 定位实验性产品—谷歌明确指出DiffusionGemma为面向研究者与开发者的实验模型,输出质量尚无法与标准Gemma 4相比,现阶段不建议用于生产环境。
- 开源许可与意义—谷歌以Apache 2.0许可证开放DiffusionGemma,为开发者提供低门槛验证空间,为AI非自回归推理效率研究提供新实验样本。
速度飙4倍,但质量打折扣
6月10日,谷歌开源了一个叫 DiffusionGemma 的实验模型,用文本扩散架构跑推理——在专用GPU上,生成速度比传统大语言模型最高快 4倍(相当于之前写一段话的时间现在能写出四段)。
这款模型强调采用 文本扩散架构(Text-to-text diffusion),目的是从新路子提升生成效率。有开发者试了说,在性能测试中,DiffusionGemma确实展现出了独特的技术优势,尤其是Intel Arc GPU上,生成速度提升了4倍。
但群里在传,谷歌内部把它定位为 面向研究者与开发者的实验性产品,根本不建议用于生产。有开发者测试后反映,输出质量跟标准的 Gemma4 比差一截,所以现阶段生产环境还是得用标准版。
速度红利有边界,低并发才香
从应用场景看,这个模型的速度优势有明确边界——性能提升主要集中在 本地设备运行 和 低并发的推理场景。一旦遇到高并发的云端部署需求,这种架构带来的速度优势就相对有限了。
谷歌把模型以 Apache 2.0许可证 向公众开放,开发者可以低成本试起来,也给AI圈探索非自回归架构的推理潜力提供了新样本。
谁难受谁受益
接下来要盯着看它能不能在低并发场景里替代自回归模型,以及 Meta、Mistral 这些对手会不会跟进出类似架构。同时,这会让 英伟达 有点难受——如果本地设备跑推理轻松快4倍,高端GPU的云端需求可能被分流。
来源: aibase阅读原文