返回新闻列表
2026-07-02 09:01

性能提升超两倍:英伟达发布 Nemotron-Labs-TwoTower 扩散语言模型

文本核心速览
  1. 开源双塔扩散语言模型英伟达开源Nemotron-Labs-TwinTower扩散语言模型,采用“上下文明”与“去噪器”双塔架构,将生成任务拆分为两个子网络,打破自回归串行解码瓶颈。
  2. 吞吐量提升2.42倍在2×H100 GPU环境下,模型在默认设置下保留基线模型98.7%的生成质量,同时实现2.42倍的吞吐量提升,平衡质量与速度。
  3. 支持三种解码方式模型提供扩散模式、模拟AR和标准AR三种解码方式,开发者可根据任务需求灵活选择,适应不同场景。
  4. 开放商业许可模型作为开放权重项目发布,遵循NVIDIA Nemotron开放模型许可协议,完全支持商业用途,面向数据团队与开发者。

英伟达双塔扩散模型吞吐量提升2.42倍,质量仅损失1.3%

英伟达7月1日开源了Nemotron-Labs-TwoTower扩散语言模型,用双塔架构在2×H100 GPU(两块H100,算力拉满)上跑出2.42倍实际生成吞吐量提升,同时保留基线模型**98.7%**的生成质量(质量几乎没掉,损失不到2%)。

瓶颈怎么破

传统自回归模型生成文字要逐个token串行解码,遇到大规模合成任务就卡在串行效率上。英伟达把流程拆成两半:上下文塔负责处理提示词,保持冻结,保留原有语言理解能力;去噪器塔专门做并行生成和优化,经过特定训练。有开发者试了说,这套设计就是在质量不掉的前提下猛推速度。

实测数字说话

  • 环境:2块H100 GPU
  • 质量保留:98.7%(基线模型的质量几乎完整保住了)
  • 吞吐提升:2.42倍(比翻倍还多,合成文本的团队直呼爽)

群里在传,对需要批量生产合成文本的数据团队,这模型就是高性能+高效率的利器。

三种解码随你切

模型支持扩散模式模拟AR标准AR三种解码方式,开发者按任务需求自由切换。目前已作为开放权重项目发布,遵循NVIDIA Nemotron开放模型许可协议,完全支持商业用途(商用随便用,不卡脖子)。

代价与短板

有团队跑代码生成和数学推理时发现,相比原始基线有轻微性能回落,而且对GPU显存有一定要求(显存吃紧的可能跑不动)。不过瑕不掩瑜,这为大模型推理加速提供了一个很实在的技术方向。

接下来盯着看:英伟达会不会后续打补丁修复代码和数学的回落?显存门槛会不会压到消费级显卡上?这会让那些靠传统自回归模型做合成数据的平台——比如对标Meta LLaMA的批量生成工具——感到直接压力。

来源: aibase阅读原文

其他新闻

查看全部