NVIDIA 发布 Nemotron-Labs Diffusion 语言模型系列,自推测模式下吞吐量达自回归的 6 倍
核心事实
2026 年 5 月 23 日,NVIDIA 发布 Nemotron-Labs Diffusion 系列语言模型,将自回归和扩散两种生成范式整合进同一模型架构。开发者用一行配置参数即可在三种模式间切换:自回归模式、扩散模式、自推测模式。在自推测模式下,8B 模型每轮前向生成的 token 数量达 Qwen3 8B 自回归模式的 6 倍(线性)/ 6.4 倍(二次),同时在准确率上反超 Qwen3 8B 约 1.2%。模型系列覆盖 3B、8B、14B 文本模型及 8B 视觉语言模型(VLM),全部含 base 和 instruct 变体,使用 NVIDIA Nemotron 开源模型许可发布,训练代码通过 Megatron Bridge 框架开源。
发生了什么
以下数据来自 NVIDIA 技术报告(2026 年 5 月发布)、Hugging Face 官方博客及多家独立技术媒体的评测。
三种生成模式
同一个模型 checkpoint,无需重新训练即可切换:
- 自回归模式:逐 token 从左到右生成,与标准 LLM 一致,保留现有开发流程兼容性。
- 扩散模式:每次并行处理一个 32-token 文本块,通过多轮迭代去噪逐步精炼输出。这个模式下模型可向前写入,也可回头修改已生成内容。
- 自推测模式(NVIDIA 推荐):扩散模式并行起草多个候选 token,自回归解码负责验证。在 temperature=0 时,输出与纯自回归完全一致,无精度损失。
吞吐量数据
| 指标 | 数值 | 对比基线 | |------|------|----------| | 扩散模式 TPF(每轮前向 token 数) | 2.6 倍 | vs 自回归 | | 自推测线性 TPF | 6 倍 | vs Qwen3 8B 自回归 | | 自推测二次 TPF | 6.4 倍 | vs Qwen3 8B 自回归 | | VLM 扩散 TPF | 3.63–7.45 倍 | vs 自回归 VLM(长响应更高) |
真实硬件上的生成速度
| 硬件 | 模式 | token/s | 倍率 | |------|------|---------|------| | GB200,单条查询 | 自推测 | 850 | 3.3x vs AR 基线 | | GB200 + 定制 CUDA kernel | 自推测 | 1015 | 4x vs AR 基线 | | B200 | 自推测 | 865 | — | | DGX Spark(w4a16 量化) | 扩散 | 112 | 2.7x vs AR 基线 | | H100 | 自推测 | 4x faster | vs AR 同模型同输出 |
准确性
- Nemotron-Labs Diffusion 8B 平均准确率比 Qwen3 8B 高 1.2%
- 在代码和数学任务上同样领先 Qwen3 8B
- 自推测模式(temperature=0)与纯自回归输出一致,零精度损失
训练路线:给自回归模型"加装"扩散能力
扩散语言模型长期面临三大障碍:准确率低于强自回归模型、训练更难、不兼容 KV cache。NVIDIA 的路线不是从零训练扩散模型,而是在已训练好的自回归模型上继续训练,叠加扩散目标。
- 预训练:1.3 万亿 token
- 监督微调:450 亿 token
- 技术借鉴:2025 年底 Efficient-DLM 论文通过修改注意力机制为分块方式,让预训练自回归模型在不丢失原有能力的前提下获得并行解码能力
NVIDIA 研究团队预计,使用优化后的采样器,扩散模式吞吐量还有 76.5% 的进一步提升空间。
开源与生态
- 模型规模:3B、8B、14B(文本)+ 8B(VLM),均含 base/instruct
- 许可证:NVIDIA Nemotron 开源模型许可
- 训练框架:Megatron Bridge 开源
- 推理框架:SGLang 已支持
为什么值得关注
自回归是 LLM 架构中最顽固的一块基石。过去所有效率优化——量化、KV cache 压缩、投机解码、MoE——都是在自回归框架内优化。扩散语言模型直接替换了生成范式本身。
三条产业链将被重新计算:
推理算力需求曲线变了。一个 GB200 GPU 在自推测模式下拿到 4 倍产出。对大模型 API 的大规模推理部署——实时风控、智能客服、文档审核——单 GPU 承载并发量上一个台阶。
API 定价的物理下限降低。大模型 API 以 token 计费,生成 token 的硬件成本直接与吞吐量挂钩。NVIDIA 既是 GPU 供应商又是推理效率的源头创新者,这层身份让算力市场的关系更复杂。
延迟敏感场景有了新路线。自回归模型每 token 必须等前一个,延迟天花板很硬。扩散语言模型可以并行起草,对语音对话、实时翻译、流式代码补全有根本性帮助。
需要冷静看的几件事
这不等价于"自回归已死"。
第一,扩散模式在 temperature>0 时和不带验证的纯扩散场景下,输出质量能否一致收敛,需要更多独立基准验证。NVIDIA 报告中最亮眼的数字都在自推测 + temperature=0 条件下——该场景结果可重现且无损失,但不能代表所有使用场景。
第二,8B 和 14B 参数规模在当前 70B+ 成为主流的时代,应用范围有限。扩散机制能否线性扩展到更大规模,训练成本是否可控,都是未解的工程问题。
第三,开源社区的落地速度是真实观察窗口。SGLang 已跟进,但生产环境的广泛部署、微调生态、量化工具链都还在起步阶段。从技术发布到产业落地,差的是生态,不是论文。
参考资料
- Towards Speed-of-Light Text Generation with Nemotron-Labs Diffusion Language Models — Hugging Face Blog
- NVIDIA AI Releases Nemotron-Labs Diffusion: A Tri-Mode Language Model with 6x Tokens Per Forward Over Qwen3 8B — MarkTechPost
- NVIDIA Pushes Past Autoregressive Text Generation with Nemotron-Labs Diffusion — StartupFortune
- Nemotron-Labs Diffusion: Tri-Mode Language Model Unifying Autoregressive and Diffusion — NVIDIA Research Publication
- NVIDIA has released the Nemotron-Labs-Diffusion diffusion language model — Gigazine