2026-07-02 09:01
性能提升超两倍:英伟达发布 Nemotron-Labs-TwoTower 扩散语言模型
文本核心速览
- 开源双塔扩散语言模型—英伟达开源Nemotron-Labs-TwinTower扩散语言模型,采用“上下文明”与“去噪器”双塔架构,将生成任务拆分为两个子网络,打破自回归串行解码瓶颈。
- 吞吐量提升2.42倍—在2×H100 GPU环境下,模型在默认设置下保留基线模型98.7%的生成质量,同时实现2.42倍的吞吐量提升,平衡质量与速度。
- 支持三种解码方式—模型提供扩散模式、模拟AR和标准AR三种解码方式,开发者可根据任务需求灵活选择,适应不同场景。
- 开放商业许可—模型作为开放权重项目发布,遵循NVIDIA Nemotron开放模型许可协议,完全支持商业用途,面向数据团队与开发者。
英伟达双塔扩散模型吞吐量提升2.42倍,质量仅损失1.3%
英伟达7月1日开源了Nemotron-Labs-TwoTower扩散语言模型,用双塔架构在2×H100 GPU(两块H100,算力拉满)上跑出2.42倍实际生成吞吐量提升,同时保留基线模型**98.7%**的生成质量(质量几乎没掉,损失不到2%)。
瓶颈怎么破
传统自回归模型生成文字要逐个token串行解码,遇到大规模合成任务就卡在串行效率上。英伟达把流程拆成两半:上下文塔负责处理提示词,保持冻结,保留原有语言理解能力;去噪器塔专门做并行生成和优化,经过特定训练。有开发者试了说,这套设计就是在质量不掉的前提下猛推速度。
实测数字说话
- 环境:2块H100 GPU
- 质量保留:98.7%(基线模型的质量几乎完整保住了)
- 吞吐提升:2.42倍(比翻倍还多,合成文本的团队直呼爽)
群里在传,对需要批量生产合成文本的数据团队,这模型就是高性能+高效率的利器。
三种解码随你切
模型支持扩散模式、模拟AR和标准AR三种解码方式,开发者按任务需求自由切换。目前已作为开放权重项目发布,遵循NVIDIA Nemotron开放模型许可协议,完全支持商业用途(商用随便用,不卡脖子)。
代价与短板
有团队跑代码生成和数学推理时发现,相比原始基线有轻微性能回落,而且对GPU显存有一定要求(显存吃紧的可能跑不动)。不过瑕不掩瑜,这为大模型推理加速提供了一个很实在的技术方向。
接下来盯着看:英伟达会不会后续打补丁修复代码和数学的回落?显存门槛会不会压到消费级显卡上?这会让那些靠传统自回归模型做合成数据的平台——比如对标Meta LLaMA的批量生成工具——感到直接压力。
来源: aibase阅读原文