阿里云、浪潮、华为一周内各自亮出超节点新方案:规模化上架、单机十万亿参数、全球首发光互联
9月18日到23日这一周里,三家公司各自拿出了一款新的算力硬件。华为在全联接大会上宣布,旗下超节点已经部署超过1000套、服务370多家客户,紧接着又发布了全球第一个用上光互联封装技术的昇腾960超节点。浪潮信息在自家的AICC大会上推出元脑SD200 Ultra,把128颗国产芯片拼进一台机器,让它能跑起10万亿参数级别的模型。阿里云则在云栖大会上宣布,一款此前只在内部验证的超节点产品,这个季度开始被规模化地卖给客户,用来给两万多亿参数的Qwen3.8-Max和Kimi K3提供实时推理服务。
三件事放在一起看,指向同一个变化:国产AI算力竞争的最小比较单元,已经从单颗芯片的参数和算力升级为超节点。超节点用高速互联把多颗芯片拼成一台逻辑上的大机器,让它们共享显存、协同计算。能不能把更多芯片塞进一个低时延互联域里、还跑得稳定,正在取代单卡性能,成为谁能率先承载五到十万亿参数级模型训练和推理的决定变量。对正在评估国产算力供给能力的金融机构CIO、CTO来说,这意味着过去那种"看单卡算力和显存规格"的评估方法已经不够用。需要换成"看超节点能联多少张卡、时延能压到多少、这套系统有没有真实客户在跑生产负载"。
这不是三家公司凑巧同一周赶上了发布节奏。同样在云栖大会上,吴泳铭公开表示千问团队计划训练5到10万亿参数规模的新模型,目标是让系统完成更复杂、更长程的任务。单颗芯片的显存和算力撑不住这个规模——一张芯片装不下万亿级参数的权重,模型必须拆分到几十甚至上百张芯片上协同运算。拆分之后的通信效率,直接决定训练能跑多快、推理能不能达到可用的时延。这正是三家公司这一周都在互联架构上做文章的原因:参数规模冲向五到十万亿,先撞到的不是芯片性能的天花板,而是芯片之间"怎么说话"的天花板。
阿里云把超节点从内部验证搬上了商业货架
吴泳铭在云栖大会上说:"本季度开始,阿里云已经规模化上架我们的AI超节点。
"这句话背后的产品是灵骏真武M890超节点:64张自研真武芯片通过800GB/s带宽互联,拼出9TB聚合显存。今年7月23日,阿里云宣布它已经稳定跑起2.4万亿参数的Qwen3.8-Max,是国内第一个能跑超过两万亿参数模型的超节点。更关键的是,这款超节点没有停在实验室里。它已经在内蒙古乌兰察布首发商用,Kimi K3和Qwen3.8-Max都已接入阿里云百炼平台对外提供推理服务。这意味着企业现在可以直接买到这套算力,而不是等阿里云内部先用上一年再对外开放。
同一场大会上,阿里云还公布了下一代芯片真武V900:算力做到M890的3倍,单集群可以扩展到50万张卡。但它要到2027年第一季度才会量产售卖。换句话说,这次"规模化上架"的主角,是已经验证过的上一代产品。阿里云把验证完的东西先推向市场,把还没验证完的东西留在路线图上,走的是先有稳定部署、再谈规模放量的节奏。
浪潮信息用紧耦合架构把单机塞进了十万亿参数,但还没看到客户
浪潮信息的元脑SD200 Ultra解决的是同一个问题的另一面。
阿里云和华为都是在已有芯片基础上扩展连接规模,浪潮则是把128颗国产芯片用3D Hyper Mesh架构紧耦合在一起。这样做出8TB统一编址显存和64TB内存,靠原生内存语义通信把芯片间时延压到0.69微秒。它还用了对称内存技术,让GPU之间可以直接访问彼此的显存,把AllReduce(多卡同步梯度和参数时的通信操作)的通信时间降低3.5倍。效果是单机就能承载2.8万亿参数的Kimi K3,跑出5.85毫秒的单次输出时延、170 tokens/s的单用户速度——官方说法是行业平均水平的5倍。架构上支持10万亿参数级前沿模型单机运行。
和阿里云、华为不同的是,浪潮信息这次发布没有提供任何已经上线的客户案例。公开资料里能看到的,全部是AICC大会现场的架构演示和实验室跑分。这不代表产品不可用,但意味着"单机装下十万亿参数"目前还是一项经过验证的工程能力,而不是一笔已经在跑的生意。浪潮信息自己的表述是,这款产品要解决行业的"能力天花板"和"产能焦虑",但还没有宣布谁已经在用它生产。
华为的光互联升级,建立在千套级部署的基础上
华为的昇腾960超节点是三家里技术跨度最大的一次升级。
它是全球第一个采用NPO(近封装光学,把光模块封装在主芯片旁边做互联,减少铜缆传输损耗)技术的超节点,单节点可连4096张卡,提供8 EFLOPS FP8算力和1PB HBM容量。相比上一代昇腾950,训练吞吐提升2.3倍、推理时延降低70%,配套的Hi-ONE自研光引擎让系统功耗下降约550千瓦,可用度做到99.8%。华为高管徐直军解释了为什么选NPO而不是更彻底的CPO(共封装光学):NPO能把光引擎做成相对独立、可单独维护的模块,成本比CPO低了近40%。这是在性能和工程可维护性之间做的平衡,不是单纯追求参数堆到最大。
但这次升级不是凭空而来。就在几天前的华为全联接大会上,公司已经公布昇腾910C超节点部署超过1000套、服务370多家客户,上一代昇腾950超节点也进入规模商用。华为是在已经验证过千套级部署的基础上,去解决下一个具体问题:传统PCIe加RoCE网络在支撑Agent这类需要频繁读写缓存的长程任务时,时延和带宽都跟不上。RoCE是一种让服务器之间绕开CPU直接读写彼此内存的网络技术,用来降低数据搬运时的时延。光互联是对这个瓶颈的直接回应,而不是又一次独立于现实部署的概念展示。
发布之后还要等两个季度:三家的下一步都卡在2027年第一季度
把三家放在一起比,会发现一个共同的时间锚点。
阿里云的下一代芯片真武V900和配套的磐久超节点服务器,要到2027年第一季度才量产上市。华为用于训练的昇腾960DT芯片,交付时间同样定在2027年第一季度,比原计划提前了三个季度。浪潮信息的SD200 Ultra虽然现在就能买到,却还没有公开的客户案例可以验证它在生产环境里的实际表现。
这意味着这一周密集发布的超节点新方案,更准确的定性是下一轮规模化的起跑点,而不是格局已经改变的终点。阿里云和华为已经用千套级的现网部署证明了超节点路线本身能稳定运行,但真正把参数规模推向五到十万亿级别的那一步,三家都还没有迈出去。要等到明年一季度前后才能看到谁先拿出可验证的客户案例。
三条路径各自押注的风险也不一样。阿里云押的是"先稳后快":这次上架的M890是已验证过的产品,风险最低,但64张卡、2.4万亿参数的规模,离五到十万亿参数还有数量级差距,要靠明年的V900补上。华为押的是"存量换代":NPO光互联要在千套级部署的客户群里逐步替换传统PCIe加RoCE方案,工程风险可控,但960DT芯片的交付一旦延后,训练端的升级就会卡住。浪潮押的是"架构领先":SD200 Ultra在纸面指标上最激进,单机就能装下十万亿参数,但缺少客户验证,意味着这些指标能不能扛住真实的生产负载波动,目前还是未知数。对需要现在就做算力采购决策的金融机构来说,可以确认的是超节点已经是真实在跑的商用基础设施。不确定的是哪一家的互联方案能在十万亿参数规模上稳定撑起生产负载,这是接下来两个季度需要持续追踪的变量。
信息来源(9)
- 阿里吴泳铭:千问将训练5-10万亿参数规模的新模型
- 阿里云灵骏真武M890适配Qwen3.8,成国内首个成功运行超2万亿参数大模型的超节点
- 阿里云:真武芯片超节点已成功适配Qwen3.8,上线百炼提供推理服务
- 阿里发布AI芯片真武V900,算力提升至真武M890的3倍
- 浪潮信息发布元脑SD200 Ultra超节点:单机承载2.8万亿参数Kimi K3,Token时延首次突破5.85毫秒
- AI算力之争不靠堆卡!浪潮信息捅破智算「能力天花板」,还瓦解了「产能焦虑」
- 对话徐直军:被低估的灵衢,重新理解AI算力
- 华为汪涛:昇腾超节点部署超1000套,昇腾960芯片研发进度超预期
- 华为昇腾960芯片定档2027年一季度