英伟达开源60B双塔扩散模型Nemotron-TwoTower:自回归的逐token瓶颈终于有人改了

英伟达开源60B双塔扩散模型Nemotron-TwoTower:自回归的逐token瓶颈终于有人改了

2026年7月2日,英伟达开源了一个挺有意思的模型——Nemotron-Labs-TwoTower

60B参数,离散扩散语言模型,基于预训练的Nemotron-3-Nano-30B-A3B改造。核心数字很简单:吞吐量 ×2.42 质量 98.7%

但我觉得值得聊的,不是这两个数字本身,而是它背后那个更大的问题——

自回归模型逐token生成的瓶颈,是不是终于有了一条工程上走得通的路?

一、先说痛点:自回归模型到底卡在哪?

过去几年,大语言模型的能力在飞速进化,但有一个底层瓶颈一直没变:生成方式

无论你用的是GPT-5.6Claude Fable 5还是Gemini 3.1,生成文本的过程本质上都是"一次吐一个token"。一个128 token的输出,就需要128次完整的模型前向传播。序列越长,延迟越高,GPU利用率越低。

这就是为什么你在用ChatGPT的时候,能看到它一个字一个字往外蹦——不是在演戏,是真的在"逐token推理"。

更麻烦的是,随着序列变长,KV cache会吃掉大量显存,batch size被迫缩小,GPU算力利用效率进一步下降。这是一个从架构层面就存在的结构性瓶颈

业界想了很多办法——投机解码(Speculative Decoding)、量化压缩、FlashAttention——但本质上都是在自回归框架内做优化,没有改变"逐token"这个根本范式。

英伟达这次做的事情,是换了一个思路。

二、双塔架构:把60B拆成两个30B,各司其职

英伟达开源60B双塔扩散模型Nemotron-TwoTower:自回归的逐token瓶颈终于有人改了

Nemotron-Labs-TwoTower的核心创新,用一句话概括就是——

把扩散语言模型中"上下文表示"和"去噪生成"这两个任务,拆到两个独立的神经网络里。

🔵 上下文塔(Context Tower)

30B参数 · 完全冻结

  • 因果式处理提示词和已确认token
  • 维护KV缓存和Mamba-2状态
  • 为去噪器塔提供每层隐层表示
  • 复用原始Nemotron-3-Nano预训练权重
  • 角色定位:负责"理解"

🟢 去噪器塔(Denoiser Tower)

30B参数 · 专门训练

  • 块内双向注意力(噪声token互相可见)
  • 层对齐交叉注意力(关注上下文塔对应层KV)
  • 上下文播种Mamba状态初始化
  • adaLN时间条件调制去噪节奏
  • 角色定位:负责"生成"

为什么这样拆?

传统扩散语言模型的问题在于:一个网络同时干两件事——既要表示干净token的上下文,又要对噪声token做去噪。这两个任务的需求是矛盾的(一个要因果单向,一个要双向全局),硬塞在同一个网络里,两边都做不好。

英伟达的做法是:既然任务不同,那就分开做。

这个思路不复杂,但工程实现很有讲究。它需要解决层对齐、状态同步、Mamba状态播种等一系列细节问题,才能在不重新训练骨干网络的前提下,让两个塔有效协作。

三、性能数据:98.7%和2.42×的真实含义

英伟达开源60B双塔扩散模型Nemotron-TwoTower:自回归的逐token瓶颈终于有人改了

任务AR基准(30B-A3B)TwoTower(扩散)变化
MMLU (5-shot)78.5678.24-0.4%
MMLU-Pro (5-shot, CoT)62.5960.93-2.7%
ARC-Challenge (25-shot)91.7292.66+1.0%
WinoGrande (5-shot)76.0976.09持平
RACE (0-shot)88.9088.90持平
HumanEval (0-shot)79.2775.58-4.7%
MBPP-Sanitized (3-shot)74.7174.28-0.6%
GSM8K (8-shot)92.4990.14-2.5%
MATH-500 (4-shot)84.4080.60-4.5%
MMLU Global Lite (5-shot)73.9773.94~持平
MGSM (8-shot)80.8080.40-0.5%
质量综合保留100%98.7%
生成吞吐量1.0×2.42×

几个关键观察

1. 常识推理和语言理解几乎无损。MMLU、WinoGrande、RACE、MGSM这些衡量语言理解和常识推理的基准,TwoTower和AR基准几乎持平。MMLU Global Lite只差了0.03分。ARC-Challenge还略有提升。

2. 代码和数学下降最明显。HumanEval下降4.7%,MATH-500下降4.5%。代码和数学推理高度依赖精确的逐步逻辑链,扩散模型的并行去噪在这方面天然不如自回归的严格顺序推理。

3. 2.42倍是端到端实测加速。不是理论峰值,是在H100上实测的wall-clock throughput。扩散模型的去噪步数远少于自回归的token-by-token步数,加上不需要维护KV cache带来的显存节省和更大的batch size,这个加速比是实打实的。

4. 训练成本极低。去噪器塔只用了~2.1T tokens训练,而骨干网络用了25T tokens。扩散头的训练成本只有骨干预训练的约8%。骨干网络完全冻结,不需要重新训练。

四、为什么这个时间点值得关注?

英伟达开源60B双塔扩散模型Nemotron-TwoTower:自回归的逐token瓶颈终于有人改了

扩散模型在图像领域早就"统治"了生成任务——Stable Diffusion、DALL-E 3、Midjourney,底层都是扩散。但在语言领域,扩散模型一直被质疑"质量损失太大"

这个质疑有道理。图像像素之间是连续的、空间相关的,去噪过程天然适合。但语言token是离散的、语义密集的,每个token的选择都可能改变整句话的含义。让扩散模型在语言上做到和自回归一样的质量,难度高得多。

过去几年的尝试——从D3PM(2021)到MDLM(2024)到SEDD——都在小规模实验上验证了可行性,但始终没有在大参数规模上给出有说服力的结果。

英伟达这次的核心突破有两点:

第一,规模上来了。60B总参数(每塔30B,激活3B),是目前公开的最大规模扩散语言模型之一。在这个规模上还能保留98.7%的质量,说明双塔分离的思路在大模型上是可行的。

第二,工程落地路径清晰。基于现有预训练模型改造,不需要从头训练;冻结骨干网络复用权重,只训练扩散头;开源权重和代码,支持商用。已经在跑Nemotron系列的团队,可以"插拔式"升级。

这两点加在一起,让扩散语言模型从"论文里的概念",进入了"可以部署的产品"。

五、对部署意味着什么?

英伟达开源60B双塔扩散模型Nemotron-TwoTower:自回归的逐token瓶颈终于有人改了

💰 单位token成本减半

吞吐量提升2.42倍,同等硬件下每个token的电力、租赁成本降到原来的约41%。对大规模推理服务来说,这是实打实的利润。

🧠 不需要KV cache

自回归模型长序列推理时KV cache吃掉大量显存。扩散生成不需要维护KV cache,同等显存下可塞更大batch。

📏 文本越长优势越大

2.42倍加速来自固定去噪步数和自回归步数的比值。短文本差距不大,长文本(文章、报告、代码)优势随序列长度放大。

🔗 与现有优化正交

和投机解码、量化压缩走完全不同的方向,理论上可叠加——如INT4量化+扩散推理,可能还有进一步提升空间。

硬件需求:运行完整双塔推理需要2张H100 80GB或2张A100 80GB。上下文塔放GPU 0,去噪器塔放GPU 1。单卡模式下只能跑纯自回归模式。

六、局限和开放问题

代码和数学推理下降明显

HumanEval降4.7%,MATH-500降4.5%。代码生成或数学推理场景下,这个质量损失不能忽视。TwoTower目前更适合语言理解、内容生成、翻译等"语义密度适中"的任务。

低延迟场景不太适合

扩散模型的去噪迭代有固定步数,首token时间不像自回归那么短。对于在线对话、实时客服等需要"秒回"的场景,延迟特征不太友好。更适合批量推理、离线内容生成、长文本处理。

硬件绑定英伟达

模型深度依赖NVIDIA GPU的CUDA生态,在非NVIDIA硬件上运行效率会明显下降。考虑到AMD MI300X和自研芯片的崛起,这个限制值得注意。

通用性待验证

目前只在Nemotron骨干上验证。社区最关心:这套方法能不能移植到Qwen、Llama、Mistral上?理论上可行,但工程实现需要有人做。如果有人做出通用adapter,生态影响会大很多。

生态还在早期

配套工具链、第三方集成、社区评测都很有限。和成熟的自回归模型生态相比,扩散语言模型的开发者体验还有很长的路要走。

七、一个值得跟踪的信号

回到开头那个问题——自回归的瓶颈,终于有人想改了?

更准确地说,英伟达这次的贡献不是"解决了"这个问题,而是证明了扩散语言模型在大参数规模上是可行的,且工程落地路径是清晰的

这对行业的意义在于:

非自回归路线不再只是学术探索。有了一个60B规模、开源、可商用的参考实现。

推理成本的优化有了新的杠杆。不只是量化和投机解码,架构层面的变革也是可能的。

英伟达在"定义下一代架构"上的野心更加明显。从芯片到CUDA到模型架构,它在AI算力链条上的话语权在持续扩大。

但也要清醒地看到:自回归模型在过去几年建立的能力壁垒(代码、数学、复杂推理)不是一朝一夕能被追平的。扩散语言模型更可能走出一条差异化的路——在长文本、高吞吐、低成本的场景中找到自己的位置,而不是完全替代自回归。

未来的大模型推理,很可能不是"一种架构打天下"

而是 自回归处理精确推理,扩散模型处理高效生成

两者协同工作

TwoTower可能不是终点,但它是一个足够清晰的起点。

暂无评论

暂无评论...
NavCN AI工具导航

NavCN是一个专业的AI工具导航网站,收录最新AI工具和热门AI应用,涵盖AI写作、AI绘画、AI视频、AI办公、AI编程等1000+AI工具,并提供AI工具推荐、评测和教程,帮助用户快速找到好用的AI工具。

Copyright © 2026 NavCN 桂ICP备2026002643号-2  Design by NavCN