🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-05-24

NVIDIA 发布 Nemotron-Labs Diffusion 语言模型系列,自推测模式下吞吐量达自回归的 6 倍

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

核心事实

2026 年 5 月 23 日,NVIDIA 发布 Nemotron-Labs Diffusion 系列语言模型,将自回归和扩散两种生成范式整合进同一模型架构。开发者用一行配置参数即可在三种模式间切换:自回归模式、扩散模式、自推测模式。在自推测模式下,8B 模型每轮前向生成的 token 数量达 Qwen3 8B 自回归模式的 6 倍(线性)/ 6.4 倍(二次),同时在准确率上反超 Qwen3 8B 约 1.2%。模型系列覆盖 3B、8B、14B 文本模型及 8B 视觉语言模型(VLM),全部含 base 和 instruct 变体,使用 NVIDIA Nemotron 开源模型许可发布,训练代码通过 Megatron Bridge 框架开源。

发生了什么

以下数据来自 NVIDIA 技术报告(2026 年 5 月发布)、Hugging Face 官方博客及多家独立技术媒体的评测。

三种生成模式

同一个模型 checkpoint,无需重新训练即可切换:

吞吐量数据

| 指标 | 数值 | 对比基线 | |------|------|----------| | 扩散模式 TPF(每轮前向 token 数) | 2.6 倍 | vs 自回归 | | 自推测线性 TPF | 6 倍 | vs Qwen3 8B 自回归 | | 自推测二次 TPF | 6.4 倍 | vs Qwen3 8B 自回归 | | VLM 扩散 TPF | 3.63–7.45 倍 | vs 自回归 VLM(长响应更高) |

真实硬件上的生成速度

| 硬件 | 模式 | token/s | 倍率 | |------|------|---------|------| | GB200,单条查询 | 自推测 | 850 | 3.3x vs AR 基线 | | GB200 + 定制 CUDA kernel | 自推测 | 1015 | 4x vs AR 基线 | | B200 | 自推测 | 865 | — | | DGX Spark(w4a16 量化) | 扩散 | 112 | 2.7x vs AR 基线 | | H100 | 自推测 | 4x faster | vs AR 同模型同输出 |

准确性

训练路线:给自回归模型"加装"扩散能力

扩散语言模型长期面临三大障碍:准确率低于强自回归模型、训练更难、不兼容 KV cache。NVIDIA 的路线不是从零训练扩散模型,而是在已训练好的自回归模型上继续训练,叠加扩散目标。

NVIDIA 研究团队预计,使用优化后的采样器,扩散模式吞吐量还有 76.5% 的进一步提升空间。

开源与生态

为什么值得关注

自回归是 LLM 架构中最顽固的一块基石。过去所有效率优化——量化、KV cache 压缩、投机解码、MoE——都是在自回归框架内优化。扩散语言模型直接替换了生成范式本身。

三条产业链将被重新计算

推理算力需求曲线变了。一个 GB200 GPU 在自推测模式下拿到 4 倍产出。对大模型 API 的大规模推理部署——实时风控、智能客服、文档审核——单 GPU 承载并发量上一个台阶。

API 定价的物理下限降低。大模型 API 以 token 计费,生成 token 的硬件成本直接与吞吐量挂钩。NVIDIA 既是 GPU 供应商又是推理效率的源头创新者,这层身份让算力市场的关系更复杂。

延迟敏感场景有了新路线。自回归模型每 token 必须等前一个,延迟天花板很硬。扩散语言模型可以并行起草,对语音对话、实时翻译、流式代码补全有根本性帮助。

需要冷静看的几件事

这不等价于"自回归已死"

第一,扩散模式在 temperature>0 时和不带验证的纯扩散场景下,输出质量能否一致收敛,需要更多独立基准验证。NVIDIA 报告中最亮眼的数字都在自推测 + temperature=0 条件下——该场景结果可重现且无损失,但不能代表所有使用场景。

第二,8B 和 14B 参数规模在当前 70B+ 成为主流的时代,应用范围有限。扩散机制能否线性扩展到更大规模,训练成本是否可控,都是未解的工程问题。

第三,开源社区的落地速度是真实观察窗口。SGLang 已跟进,但生产环境的广泛部署、微调生态、量化工具链都还在起步阶段。从技术发布到产业落地,差的是生态,不是论文。

参考资料

图文卡片 ⬇️ 一键下载图文卡片