
2026年7月2日,英伟达开源了一个挺有意思的模型——Nemotron-Labs-TwoTower。
60B参数,离散扩散语言模型,基于预训练的Nemotron-3-Nano-30B-A3B改造。核心数字很简单:吞吐量 ×2.42 质量 98.7%。
但我觉得值得聊的,不是这两个数字本身,而是它背后那个更大的问题——
自回归模型逐token生成的瓶颈,是不是终于有了一条工程上走得通的路?
一、先说痛点:自回归模型到底卡在哪?
过去几年,大语言模型的能力在飞速进化,但有一个底层瓶颈一直没变:生成方式。
无论你用的是GPT-5.6、Claude Fable 5还是Gemini 3.1,生成文本的过程本质上都是"一次吐一个token"。一个128 token的输出,就需要128次完整的模型前向传播。序列越长,延迟越高,GPU利用率越低。
这就是为什么你在用ChatGPT的时候,能看到它一个字一个字往外蹦——不是在演戏,是真的在"逐token推理"。
更麻烦的是,随着序列变长,KV cache会吃掉大量显存,batch size被迫缩小,GPU算力利用效率进一步下降。这是一个从架构层面就存在的结构性瓶颈。
业界想了很多办法——投机解码(Speculative Decoding)、量化压缩、FlashAttention——但本质上都是在自回归框架内做优化,没有改变"逐token"这个根本范式。
英伟达这次做的事情,是换了一个思路。
二、双塔架构:把60B拆成两个30B,各司其职
Nemotron-Labs-TwoTower的核心创新,用一句话概括就是——
把扩散语言模型中"上下文表示"和"去噪生成"这两个任务,拆到两个独立的神经网络里。
🔵 上下文塔(Context Tower)
30B参数 · 完全冻结
- 因果式处理提示词和已确认token
- 维护KV缓存和Mamba-2状态
- 为去噪器塔提供每层隐层表示
- 复用原始Nemotron-3-Nano预训练权重
- 角色定位:负责"理解"
🟢 去噪器塔(Denoiser Tower)
30B参数 · 专门训练
- 块内双向注意力(噪声token互相可见)
- 层对齐交叉注意力(关注上下文塔对应层KV)
- 上下文播种Mamba状态初始化
- adaLN时间条件调制去噪节奏
- 角色定位:负责"生成"
为什么这样拆?
传统扩散语言模型的问题在于:一个网络同时干两件事——既要表示干净token的上下文,又要对噪声token做去噪。这两个任务的需求是矛盾的(一个要因果单向,一个要双向全局),硬塞在同一个网络里,两边都做不好。
英伟达的做法是:既然任务不同,那就分开做。
这个思路不复杂,但工程实现很有讲究。它需要解决层对齐、状态同步、Mamba状态播种等一系列细节问题,才能在不重新训练骨干网络的前提下,让两个塔有效协作。
三、性能数据:98.7%和2.42×的真实含义
| 任务 | AR基准(30B-A3B) | TwoTower(扩散) | 变化 |
|---|---|---|---|
| MMLU (5-shot) | 78.56 | 78.24 | -0.4% |
| MMLU-Pro (5-shot, CoT) | 62.59 | 60.93 | -2.7% |
| ARC-Challenge (25-shot) | 91.72 | 92.66 | +1.0% |
| WinoGrande (5-shot) | 76.09 | 76.09 | 持平 |
| RACE (0-shot) | 88.90 | 88.90 | 持平 |
| HumanEval (0-shot) | 79.27 | 75.58 | -4.7% |
| MBPP-Sanitized (3-shot) | 74.71 | 74.28 | -0.6% |
| GSM8K (8-shot) | 92.49 | 90.14 | -2.5% |
| MATH-500 (4-shot) | 84.40 | 80.60 | -4.5% |
| MMLU Global Lite (5-shot) | 73.97 | 73.94 | ~持平 |
| MGSM (8-shot) | 80.80 | 80.40 | -0.5% |
| 质量综合保留 | 100% | 98.7% | ✓ |
| 生成吞吐量 | 1.0× | 2.42× | ✓ |
几个关键观察
1. 常识推理和语言理解几乎无损。MMLU、WinoGrande、RACE、MGSM这些衡量语言理解和常识推理的基准,TwoTower和AR基准几乎持平。MMLU Global Lite只差了0.03分。ARC-Challenge还略有提升。
2. 代码和数学下降最明显。HumanEval下降4.7%,MATH-500下降4.5%。代码和数学推理高度依赖精确的逐步逻辑链,扩散模型的并行去噪在这方面天然不如自回归的严格顺序推理。
3. 2.42倍是端到端实测加速。不是理论峰值,是在H100上实测的wall-clock throughput。扩散模型的去噪步数远少于自回归的token-by-token步数,加上不需要维护KV cache带来的显存节省和更大的batch size,这个加速比是实打实的。
4. 训练成本极低。去噪器塔只用了~2.1T tokens训练,而骨干网络用了25T tokens。扩散头的训练成本只有骨干预训练的约8%。骨干网络完全冻结,不需要重新训练。
四、为什么这个时间点值得关注?
扩散模型在图像领域早就"统治"了生成任务——Stable Diffusion、DALL-E 3、Midjourney,底层都是扩散。但在语言领域,扩散模型一直被质疑"质量损失太大"。
这个质疑有道理。图像像素之间是连续的、空间相关的,去噪过程天然适合。但语言token是离散的、语义密集的,每个token的选择都可能改变整句话的含义。让扩散模型在语言上做到和自回归一样的质量,难度高得多。
过去几年的尝试——从D3PM(2021)到MDLM(2024)到SEDD——都在小规模实验上验证了可行性,但始终没有在大参数规模上给出有说服力的结果。
英伟达这次的核心突破有两点:
第一,规模上来了。60B总参数(每塔30B,激活3B),是目前公开的最大规模扩散语言模型之一。在这个规模上还能保留98.7%的质量,说明双塔分离的思路在大模型上是可行的。
第二,工程落地路径清晰。基于现有预训练模型改造,不需要从头训练;冻结骨干网络复用权重,只训练扩散头;开源权重和代码,支持商用。已经在跑Nemotron系列的团队,可以"插拔式"升级。
这两点加在一起,让扩散语言模型从"论文里的概念",进入了"可以部署的产品"。
五、对部署意味着什么?
💰 单位token成本减半
吞吐量提升2.42倍,同等硬件下每个token的电力、租赁成本降到原来的约41%。对大规模推理服务来说,这是实打实的利润。
🧠 不需要KV cache
自回归模型长序列推理时KV cache吃掉大量显存。扩散生成不需要维护KV cache,同等显存下可塞更大batch。
📏 文本越长优势越大
2.42倍加速来自固定去噪步数和自回归步数的比值。短文本差距不大,长文本(文章、报告、代码)优势随序列长度放大。
🔗 与现有优化正交
和投机解码、量化压缩走完全不同的方向,理论上可叠加——如INT4量化+扩散推理,可能还有进一步提升空间。
硬件需求:运行完整双塔推理需要2张H100 80GB或2张A100 80GB。上下文塔放GPU 0,去噪器塔放GPU 1。单卡模式下只能跑纯自回归模式。
六、局限和开放问题
代码和数学推理下降明显
HumanEval降4.7%,MATH-500降4.5%。代码生成或数学推理场景下,这个质量损失不能忽视。TwoTower目前更适合语言理解、内容生成、翻译等"语义密度适中"的任务。
低延迟场景不太适合
扩散模型的去噪迭代有固定步数,首token时间不像自回归那么短。对于在线对话、实时客服等需要"秒回"的场景,延迟特征不太友好。更适合批量推理、离线内容生成、长文本处理。
硬件绑定英伟达
模型深度依赖NVIDIA GPU的CUDA生态,在非NVIDIA硬件上运行效率会明显下降。考虑到AMD MI300X和自研芯片的崛起,这个限制值得注意。
通用性待验证
目前只在Nemotron骨干上验证。社区最关心:这套方法能不能移植到Qwen、Llama、Mistral上?理论上可行,但工程实现需要有人做。如果有人做出通用adapter,生态影响会大很多。
生态还在早期
配套工具链、第三方集成、社区评测都很有限。和成熟的自回归模型生态相比,扩散语言模型的开发者体验还有很长的路要走。
七、一个值得跟踪的信号
回到开头那个问题——自回归的瓶颈,终于有人想改了?
更准确地说,英伟达这次的贡献不是"解决了"这个问题,而是证明了扩散语言模型在大参数规模上是可行的,且工程落地路径是清晰的。
这对行业的意义在于:
• 非自回归路线不再只是学术探索。有了一个60B规模、开源、可商用的参考实现。
• 推理成本的优化有了新的杠杆。不只是量化和投机解码,架构层面的变革也是可能的。
• 英伟达在"定义下一代架构"上的野心更加明显。从芯片到CUDA到模型架构,它在AI算力链条上的话语权在持续扩大。
但也要清醒地看到:自回归模型在过去几年建立的能力壁垒(代码、数学、复杂推理)不是一朝一夕能被追平的。扩散语言模型更可能走出一条差异化的路——在长文本、高吞吐、低成本的场景中找到自己的位置,而不是完全替代自回归。




