🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-08-18

CoreWeave 用 8,192 张 GB300 NVL72 把 DeepSeek-V3 671B 训练压到 2.02 分钟:前沿训练的瓶颈已从「模型配方」转向「集群工程」

正在发生的事很多,这件帮你看过了

2026-08-18

一、触发新闻与一句话定义

CoreWeave 在 2026 年 8 月 17 日公布,其在 MLPerf Training v6.0 中用 8,192 张 NVIDIA GB300 NVL72 GPU 完成 DeepSeek-V3 671B 训练,耗时 2.02 分钟,为该轮基准最快结果;配套白皮书同步公开了成绩背后的集群工程细节。

本报告研究的对象是:万卡级 Blackwell Ultra 互联集群把前沿 671B 稠密 MoE 模型的全量训练时间压到分钟级的能力本身——它背后是数千卡互联、液冷、存储和通信架构,以及当训练时间不再稀缺之后,行业竞争会转移到哪里的问题。

二、纵向分析:从诞生到当下

先追模型侧的线。DeepSeek-V3 不是凭空出现的基准负载。2024 年 5 月,DeepSeek-V2 以 236B 总参数、每次激活 21B 的 DeepSeekMoE + MLA 组合,配上极低的 API 价格,掀起了国内大模型 API 价格战;2024 年 12 月,DeepSeek-V3 正式发布:671B 总参数、每次激活 37B,预训练 14.8T token,在 2,048 张 H800 上跑了约 278.8 万 GPU 小时(约 57 天),按每卡小时约 2 美元计算成本约 557.6 万美元。它把 FP8 混合精度、MLA、无辅助损失负载均衡、多 token 预测一起塞进了开放权重模型。到 2026 年 8 月,V3 671B 被 MLPerf Training v6.0 用作训练负载——开放权重 MoE 模型成了行业公认的"前沿标准尺寸"。

再追基准与硬件的线。MLPerf Training 的早期轮次还在跑 ResNet-50 这类模型,成绩以天计;2024 年的 Training v4.0 引入 GPT-3 175B,NVIDIA 用 11,616 张 H100 把成绩压到约 3.4 分钟。同一时期,NVIDIA 的数据中心代际也在把"训练单位"从单卡变成机柜:H100 还是 8 卡 HGX,GB200 NVL72(2024–2025)开始把 72 张 GPU 接进一个 NVLink 域、配 192GB HBM 和机柜级液冷;GB300 NVL72(2025–2026,Blackwell Ultra)把单卡 HBM 提到 288GB、NVLink 带宽继续抬升,万卡规模的互联与液冷成为默认前提。

最后追运行商的线。CoreWeave 2017 年从以太坊矿场起家,2019 年转 GPU 云,2023 年靠 H100 大单和微软合约起量,2025 年上市并签下 OpenAI 长约;到 2026 年,它用一份 MLPerf 白皮书把万卡训练工程公开成可核验的交付物。这条路线上最值得记住的一个换算:2.02 分钟 × 8,192 张 GPU ≈ 276 GPU 小时。与 2024 年 V3 原始训练的 278.8 万 H800 GPU 小时相比,差了约四个数量级。两边口径并不完全对齐——MLPerf 用统一数据集和收敛判据,不等于把 14.8T token 重跑一遍——但这个数量级差距本身,就是这条纵向线最硬的事实:前沿模型训练的边际时间成本已经被压缩到了工程动作的尺度。

三、横向分析:竞争图谱

同一基准上的两条芯片路线。 就在 CoreWeave 公布成绩的同一天,SemiAnalysis 传出 Google TPUv9 继续走双轨:推理芯片 TPUv9i 用新版 Boardfly,训练芯片 TPUv9t 引入 3D Torus 的演进而来的 6D Torus。此前 TPUv8t 已经靠 3D Torus 把 scale-up 域扩到最多 9,600 颗互联芯片。SemiAnalysis 的网络模型给出了更具体的变量:4,096 芯片在 16×16×16 的 3D Torus 下最坏要 24 跳,4⁶ 的 6D Torus 把最坏跳数降到 12,平分带宽也增加,代价是更多光模块和 OCS 容量。这说明本轮竞争的核心指标不是单卡 FLOPs,而是数千卡拓扑里的最坏跳数和平分带宽。NVIDIA 路线用 NVLink 大域把 72 张卡做成"机柜即单元",Google 路线用更高维 Torus 摊薄跳数,两边解决的是同一个问题:模型并行和专家路由时,卡与卡的通信能不能跟上计算。

同一赛道上的运行商。 CoreWeave 拿 MLPerf 榜首加白皮书,本质是把"我能交付万卡训练"做成可核算的品牌;同一天它还展示了 Serverless RL 团队与 NVIDIA 对齐的 RL 训练实践——更快 rollout、保持 on-policy、小模型也能打。而 Groq 在 8 月 17 日宣布 3.5 亿美元 A 轮、计划引入 Nvidia 参投,从 LPU 推理芯片转向 neocloud,机房规模从 54MW 扩到明年 200MW 以上,卖的是中大型 Nvidia 加速计算集群。一家自研推理芯片的公司反过来买 Nvidia 卡做云服务,说明这轮训练与推理基础设施的钱都流向同一个资产类别。同一赛道里还有 Lambda、Nebius 等第二梯队 neocloud 争夺同样的 GPU 配额,区别在于是否具备 CoreWeave 这种万卡互联的交付记录;再往上,微软、谷歌、亚马逊和 Oracle 各自握着万卡到数十万卡规模的训练集群,是这条服务链上的最终供给方。

价值链再往上一层:自建与租用的分叉。 同一天另有一条消息:OpenAI 与 SB Energy 签约,在俄亥俄州锁定约 8GW 的 AI 容量,由 SB Energy 建设并运营 PORTS-Pike 数据中心,20 年租约,2028 年首发 800MW,全面投产要到 2032 年;园区只跑 NVIDIA 算力,NVIDIA 同时向 SB Energy 投资 15 亿美元。CoreWeave 的 2.02 分钟证明了"租用集群也能跑前沿训练",而 OpenAI 的 8GW 说明头部实验室正把这种能力变成自有资产。两条路同时成立,争夺的是 2028 年之后的算力主权。

四、横纵交汇洞察

其一,训练时间不再是稀缺资源,稀缺的是"已经通电的万卡互联集群"。 276 GPU 小时意味着,在口径意义上一次 671B 级训练已经是小时级动作;真正的门槛是 8,192 张 GB300 NVL72 的采购、供电、液冷、网络和存储是否已在位。前沿训练的主战场从"谁的配方好"转向"谁的资产已经就位"。

其二,MLPerf 从芯片跑分升级成了集群工程的交付考试。 这次拿榜首的不是芯片厂,而是买卡建云的 CoreWeave,并且它还发白皮书交代工程实现。跑分的意义随之改变:一个租卡公司也能把训练能力做成可核算、可复制的交付物,下游客户看的不再是单卡指标,而是"同样的万卡互联我能不能复制"。

其三,万卡域的网络拓扑成为下一代硬件竞争的关键变量。 GB300 NVL72 的大域 NVLink 和 TPUv9 传闻中的 6D Torus 在同一天撞上同一个问题:把 4,096 芯片的最坏跳数从 24 降到 12。谁能把平分带宽和光模块、OCS 成本同时做平衡,谁就掌握下一代训练集群的单位成本。这一判断与近期"AI 数据中心瓶颈从算力转向网络"的观察互相印证,但结论更进一步:网络已经不是瓶颈,网络拓扑本身就是竞争力。

其四,开放权重模型成为"标准载荷",训练能力向基础设施公司扩散。 MLPerf 把 DeepSeek-V3 671B 作为训练负载,等于承认开权重 MoE 是行业公认的前沿尺寸;任何持有万卡集群的一方都可以复现、蒸馏、后训练。模型数量会越来越多,"谁有模型"的稀缺性在下降,"谁有集群"的稀缺性在上升。CoreWeave 这份白皮书可以理解为这个转移过程的一份产品说明书。

五、信息来源

图文卡片 ⬇️ 一键下载图文卡片