返回新闻列表
2026-06-11 10:35

谷歌联合英伟达发布开源模型DiffusionGemma:引入扩散机制,单卡推理提速4倍

文章提及的 AI 工具GemmaGoogle AI提示词库MLX
文本核心速览
  1. 扩散机制文本生成谷歌联合英伟达发布DiffusionGemma,将图像扩散模型应用到文本领域,从随机噪声迭代优化,并行输出256个词块,打破自回归限制。
  2. 单卡推理提速4倍经英伟达优化,单GPU单用户模式速度比同类传统模型快近4倍,H100显卡输出速度达每秒1000个标记,RTX5090上超700个。
  3. 260亿参数混合专家模型采用MoE架构,总参数量260亿,单步激活仅38亿,兼顾效率与能力,在标准基准测试中略逊于传统Gemma4。
  4. 全块感知非线性优势所有标记可相互引用,在文本后补、代码填空、数独求解及氨基酸序列等非线性数据结构任务中表现显著优于传统自回归模型。
## 谷歌10号开源了DiffusionGemma——从噪声里一口气蹦出256个词 谷歌在2026年6月10日把DiffusionGemma的权重扔上了Hugging Face,这个260亿参数的实验模型不按规则逐字生成,而是从随机噪声里迭代优化,一口气输出256个标记的词块。有开发者试了说,在H100显卡上跑单条请求时,输出速度能达到每秒1000个标记,哪怕是RTX5090这种高端消费级显卡也能突破每秒700个标记——这比同类传统模型快了近四倍,全靠英伟达在单GPU单用户模式下的深度优化。 ## 参数堆得巧,激活却很少 DiffusionGemma的260亿参数依托混合专家(MoE)架构,单步激活参数只有38亿。基准测试里,它的文本生成质量和准确率确实略输给传统的Gemma4系列,但群里在传,这模型的“全块感知”能力让所有标记在生成时可以互相引用,打破了自回归模型只能向后推演的局限。在文本后补、代码填空、数独求解以及氨基酸序列这些非线性、结构化数据处理任务里,它表现出了明显优势。 ## 开源协议宽松,兼容框架多 模型权重基于Apache2.0协议开源,完全兼容vLLM、MLX等主流推理框架。有开发者试了说,这模型不仅打破了内存带宽对GPU算力的制约,也为未来AI处理复杂逻辑和非线性文本生成开了条新路。 ## 接下来盯着什么 这会让做代码填空、数独求解的团队捡到宝,同时让靠自回归模型吃饭的老牌玩家感到压力——尤其是那些还在堆算力拼长度的厂商。
来源: aibase阅读原文

其他新闻

查看全部