CoreWeave 用 8,192 张 GB300 NVL72 把 DeepSeek-V3 671B 训练压到 2.02 分钟:前沿训练的瓶颈已从「模型配方」转向「集群工程」
2026-08-18
一、触发新闻与一句话定义
CoreWeave 在 2026 年 8 月 17 日公布,其在 MLPerf Training v6.0 中用 8,192 张 NVIDIA GB300 NVL72 GPU 完成 DeepSeek-V3 671B 训练,耗时 2.02 分钟,为该轮基准最快结果;配套白皮书同步公开了成绩背后的集群工程细节。
本报告研究的对象是:万卡级 Blackwell Ultra 互联集群把前沿 671B 稠密 MoE 模型的全量训练时间压到分钟级的能力本身——它背后是数千卡互联、液冷、存储和通信架构,以及当训练时间不再稀缺之后,行业竞争会转移到哪里的问题。
二、纵向分析:从诞生到当下
先追模型侧的线。DeepSeek-V3 不是凭空出现的基准负载。2024 年 5 月,DeepSeek-V2 以 236B 总参数、每次激活 21B 的 DeepSeekMoE + MLA 组合,配上极低的 API 价格,掀起了国内大模型 API 价格战;2024 年 12 月,DeepSeek-V3 正式发布:671B 总参数、每次激活 37B,预训练 14.8T token,在 2,048 张 H800 上跑了约 278.8 万 GPU 小时(约 57 天),按每卡小时约 2 美元计算成本约 557.6 万美元。它把 FP8 混合精度、MLA、无辅助损失负载均衡、多 token 预测一起塞进了开放权重模型。到 2026 年 8 月,V3 671B 被 MLPerf Training v6.0 用作训练负载——开放权重 MoE 模型成了行业公认的"前沿标准尺寸"。
再追基准与硬件的线。MLPerf Training 的早期轮次还在跑 ResNet-50 这类模型,成绩以天计;2024 年的 Training v4.0 引入 GPT-3 175B,NVIDIA 用 11,616 张 H100 把成绩压到约 3.4 分钟。同一时期,NVIDIA 的数据中心代际也在把"训练单位"从单卡变成机柜:H100 还是 8 卡 HGX,GB200 NVL72(2024–2025)开始把 72 张 GPU 接进一个 NVLink 域、配 192GB HBM 和机柜级液冷;GB300 NVL72(2025–2026,Blackwell Ultra)把单卡 HBM 提到 288GB、NVLink 带宽继续抬升,万卡规模的互联与液冷成为默认前提。
最后追运行商的线。CoreWeave 2017 年从以太坊矿场起家,2019 年转 GPU 云,2023 年靠 H100 大单和微软合约起量,2025 年上市并签下 OpenAI 长约;到 2026 年,它用一份 MLPerf 白皮书把万卡训练工程公开成可核验的交付物。这条路线上最值得记住的一个换算:2.02 分钟 × 8,192 张 GPU ≈ 276 GPU 小时。与 2024 年 V3 原始训练的 278.8 万 H800 GPU 小时相比,差了约四个数量级。两边口径并不完全对齐——MLPerf 用统一数据集和收敛判据,不等于把 14.8T token 重跑一遍——但这个数量级差距本身,就是这条纵向线最硬的事实:前沿模型训练的边际时间成本已经被压缩到了工程动作的尺度。
三、横向分析:竞争图谱
同一基准上的两条芯片路线。 就在 CoreWeave 公布成绩的同一天,SemiAnalysis 传出 Google TPUv9 继续走双轨:推理芯片 TPUv9i 用新版 Boardfly,训练芯片 TPUv9t 引入 3D Torus 的演进而来的 6D Torus。此前 TPUv8t 已经靠 3D Torus 把 scale-up 域扩到最多 9,600 颗互联芯片。SemiAnalysis 的网络模型给出了更具体的变量:4,096 芯片在 16×16×16 的 3D Torus 下最坏要 24 跳,4⁶ 的 6D Torus 把最坏跳数降到 12,平分带宽也增加,代价是更多光模块和 OCS 容量。这说明本轮竞争的核心指标不是单卡 FLOPs,而是数千卡拓扑里的最坏跳数和平分带宽。NVIDIA 路线用 NVLink 大域把 72 张卡做成"机柜即单元",Google 路线用更高维 Torus 摊薄跳数,两边解决的是同一个问题:模型并行和专家路由时,卡与卡的通信能不能跟上计算。
同一赛道上的运行商。 CoreWeave 拿 MLPerf 榜首加白皮书,本质是把"我能交付万卡训练"做成可核算的品牌;同一天它还展示了 Serverless RL 团队与 NVIDIA 对齐的 RL 训练实践——更快 rollout、保持 on-policy、小模型也能打。而 Groq 在 8 月 17 日宣布 3.5 亿美元 A 轮、计划引入 Nvidia 参投,从 LPU 推理芯片转向 neocloud,机房规模从 54MW 扩到明年 200MW 以上,卖的是中大型 Nvidia 加速计算集群。一家自研推理芯片的公司反过来买 Nvidia 卡做云服务,说明这轮训练与推理基础设施的钱都流向同一个资产类别。同一赛道里还有 Lambda、Nebius 等第二梯队 neocloud 争夺同样的 GPU 配额,区别在于是否具备 CoreWeave 这种万卡互联的交付记录;再往上,微软、谷歌、亚马逊和 Oracle 各自握着万卡到数十万卡规模的训练集群,是这条服务链上的最终供给方。
价值链再往上一层:自建与租用的分叉。 同一天另有一条消息:OpenAI 与 SB Energy 签约,在俄亥俄州锁定约 8GW 的 AI 容量,由 SB Energy 建设并运营 PORTS-Pike 数据中心,20 年租约,2028 年首发 800MW,全面投产要到 2032 年;园区只跑 NVIDIA 算力,NVIDIA 同时向 SB Energy 投资 15 亿美元。CoreWeave 的 2.02 分钟证明了"租用集群也能跑前沿训练",而 OpenAI 的 8GW 说明头部实验室正把这种能力变成自有资产。两条路同时成立,争夺的是 2028 年之后的算力主权。
四、横纵交汇洞察
其一,训练时间不再是稀缺资源,稀缺的是"已经通电的万卡互联集群"。 276 GPU 小时意味着,在口径意义上一次 671B 级训练已经是小时级动作;真正的门槛是 8,192 张 GB300 NVL72 的采购、供电、液冷、网络和存储是否已在位。前沿训练的主战场从"谁的配方好"转向"谁的资产已经就位"。
其二,MLPerf 从芯片跑分升级成了集群工程的交付考试。 这次拿榜首的不是芯片厂,而是买卡建云的 CoreWeave,并且它还发白皮书交代工程实现。跑分的意义随之改变:一个租卡公司也能把训练能力做成可核算、可复制的交付物,下游客户看的不再是单卡指标,而是"同样的万卡互联我能不能复制"。
其三,万卡域的网络拓扑成为下一代硬件竞争的关键变量。 GB300 NVL72 的大域 NVLink 和 TPUv9 传闻中的 6D Torus 在同一天撞上同一个问题:把 4,096 芯片的最坏跳数从 24 降到 12。谁能把平分带宽和光模块、OCS 成本同时做平衡,谁就掌握下一代训练集群的单位成本。这一判断与近期"AI 数据中心瓶颈从算力转向网络"的观察互相印证,但结论更进一步:网络已经不是瓶颈,网络拓扑本身就是竞争力。
其四,开放权重模型成为"标准载荷",训练能力向基础设施公司扩散。 MLPerf 把 DeepSeek-V3 671B 作为训练负载,等于承认开权重 MoE 是行业公认的前沿尺寸;任何持有万卡集群的一方都可以复现、蒸馏、后训练。模型数量会越来越多,"谁有模型"的稀缺性在下降,"谁有集群"的稀缺性在上升。CoreWeave 这份白皮书可以理解为这个转移过程的一份产品说明书。
五、信息来源
- CoreWeave:2.02 minutes time-to-train for DeepSeek-V3 671B on 8,192 GB300 NVL72 GPUs(X 官方帖) https://x.com/CoreWeave/status/2089476517843644755
- CoreWeave 白皮书:Scaling frontier-class AI training on CoreWeave — MLPerf Training v6.0 results 技术分析 https://coreweave.com/resources/whitepapers/scaling-frontier-class-ai-training-on-coreweave-a-deep-technical-analysis-of-mlperf-r-training-v6-0-results
- SemiAnalysis:Google TPUv9 维持双轨,训练版引入 6D Torus https://x.com/SemiAnalysis_/status/2089472655053185243
- SemiAnalysis:6D Torus 把 4,096 芯片最坏跳数从 24 降至 12 https://x.com/SemiAnalysis_/status/2089472661889884591
- Groq:$350M Series A 与 neocloud 扩展公告(X 官方帖) https://x.com/GroqInc/status/2089362036774035513
- TechCrunch:Groq raises $350M to fuel its pivot from AI chips to neocloud https://techcrunch.com/2026/08/17/groq-raises-350m-to-fuel-its-pivot-from-ai-chips-to-neocloud/
- CoreWeave:Serverless RL 团队与 NVIDIA 对齐 RL 训练实践(X 官方帖) https://x.com/CoreWeave/status/2089382525361692832
- kimmonismus:OpenAI 锁定俄亥俄州约 8GW AI 容量(X 帖) https://x.com/kimmonismus/status/2089371190276092299
- TechCrunch:Nvidia investing $1.5B in SoftBank data center developer behind OpenAI project https://techcrunch.com/2026/08/17/nvidia-investing-1-5b-in-softbank-data-center-developer-behind-openai-project/
- DeepSeek-V3 官方仓库(历史训练数据背景) https://github.com/deepseek-ai/DeepSeek-V3
- MLCommons:MLPerf Training 基准官方页(基准演进背景) https://mlcommons.org/benchmarks/training/