🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-07-30

智谱为什么同时要1GW算力与一支编译器团队

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

2026年7月29日

7月21日,多家媒体报道称,智谱(Z.ai)已落地1GW级国产AI算力数据中心建设,并完成对国产AI异构算力软件公司中科加禾(XCore Sigma)的收购。[1][2][3][4]

这两件事解决的不是同一个问题:1GW争取的是供给控制权,中科加禾争取的是效率控制权。前者回答「有没有算力」,后者回答「不同国产芯片能否把理论峰值稳定变成可售卖的Token」。智谱并非要转型为数据中心公司,而是在算力约束下,把「模型—编译—运行时—集群—电力」中最影响交付与成本的环节握得更紧。

必须先划清事实边界。第一财经称「已落地1GW级建设」,同时写明智谱官方截至发稿暂未回应;公开信息没有披露项目位置、单站还是多站、已上电容量、芯片供应商、芯片数量、总投资和利用率。[1] 因此,1GW只能理解为已披露的项目级容量口径,不能等同于1GW芯片已经满载运行;收购金额、持股方式和整合计划也未公开。

从外购算力到控制关键接口

智谱原本是典型的独立模型公司。招股书显示,其供应商包括算力硬件、算力服务、服务器、存储和网络设备提供商,通常与云服务商签一至四年框架协议;2024年五大供应商占采购额47.3%,最大供应商是一家大型互联网公司旗下云服务商,当年向其提供3.95亿元计算服务。[6]

轻资产路线曾带来灵活性。2025年,智谱把算力采购从较多设备租赁调整为以服务采购为主、设备租赁为辅,年度资本开支由4.62亿元降至7470万元。[6][7] 但当需求陡升,灵活性会变成对供应商排期、价格和硬件配置的依赖。智谱2025年收入7.24亿元,同比增长131.9%,研发开支31.80亿元,亏损47.18亿元;云端业务毛利率由2024年的3.3%升至2025年的18.9%,仍低于本地化部署的48.8%。年报还明确披露,2026年2月以来出现供不应求的算力缺口。[7]

这些数字说明:需求已被验证,但推理效率尚未形成足够厚的利润,算力规模、Token单位成本和供应确定性已经进入经营核心。1GW是用资本与长期承诺购买供给确定性,中科加禾则要把拿到的国产芯片更高效地变成Token。

两条时间线为何在2026年汇合

智谱2019年由清华大学计算机系知识工程实验室(KEG)成果转化而来,2021年发布自研预训练框架GLM,2022年开源GLM-130B。[5] 这段起点留下两项长期约束:独立模型路线带来技术品牌与客户中立性,却没有母公司云提供自有算力;从预训练框架开始的全栈自研倾向,则让技术边界自然从模型向算子、编译和芯片适配延伸。

2023年的ChatGLM把模型推入产品现场。训练是阶段性峰值负载,依赖大集群同步、网络与故障恢复;API推理则每天发生,直接受每Token成本、首字延迟、吞吐、KV Cache、批处理和弹性调度影响。到2024年,GLM-4系列、视频语音模型和AutoGLM又扩大了模型与部署组合。

智谱很早就在做国产适配,而非到2026年才开始。招股书显示,截至2025年6月底,其模型已兼容40多款主流硬件芯片,并有自研算子库和芯算一体方案。[6] 这扩大了供应弹性和政企交付面,也制造了持续的软件税:模型每次改变注意力结构、量化方式或并行策略,都可能触发多种软硬件组合的重新适配。

中科加禾恰好处理「芯片有了,性能没出来」。公司成立于2023年7月,团队主要来自中国科学院计算技术研究所,长期参与CPU、GPU和NPU编译器研发;产品方向包括大模型推理引擎、微调框架和AI编译工具套件。[4][8][11] 其方案在Tensor表达式层分析全局数据流并跨算子融合,2024年公开材料称在部分网络、特定测试条件下相对当时先进方案最高加速3.7倍;这个数字不能外推到GLM或所有国产芯片。[8] 到2025年,其案例已涉及头部互联网企业的华为昇腾推理集群,SigInfer也被定位为以编译为核心的高性能AI推理引擎。[9][10]

2025年,GLM-4.5至GLM-4.7和AutoGLM把负载推向代码与长程智能体。一次任务可能触发几十次甚至上百次模型调用,用户看到一个任务,后台承担一串Token、工具反馈和多个推理阶段。模型越会执行任务,基础设施压力越大。

2026年,智谱开始从「适配国产卡」转向软硬共同设计。年报称公司将加强国产芯片Day 0适配,即模型上线时国产芯片就可用;GLM-5还以定制融合内核、FlashComm、MLA、动态稀疏注意力等降低通信、KV Cache和长序列开销,Slime框架通过异步强化学习、Prefill-Decode分离和容错提高GPU利用率。[7] 但旗舰模型可以专项攻坚,几十款芯片、持续迭代的模型和大量客户环境不能永久依赖项目制人肉适配。

因此,1GW与收购同时出现并非巧合。只有算力中心,智谱可能有更多卡却受制于算子、通信和运行时;只有软件团队,它可以提高效率却仍要争夺稀缺芯片和上电容量。两者结合才可能形成闭环:GLM真实负载暴露瓶颈,中科加禾优化编译与运行时,结果反过来影响下一代模型和集群设计,算力中心再用大规模生产负载验证改动。

四种路线交换的是控制权、速度与风险

| 路线 | 代表对象 | 控制方式 | 优势 | 主要风险 | |---|---|---|---|---| | 全栈自有 | Google、阿里巴巴 | 自研芯片,控制数据中心、模型、编译与云平台 | 反馈链短,协同深,可摊薄成本 | 投资巨大,组织复杂 | | 联盟式巨型基础设施 | OpenAI | 依靠合资、长期承购和伙伴锁定GW级容量 | 扩张快,供应来源多 | 合同承诺重,伙伴依赖强 | | 独立模型公司向下整合 | 智谱 | 多种国产芯片、项目级容量,加上收购编译与异构推理团队 | 保持芯片选择,缩短适配链 | 资金、规模与整合能力承压 | | 轻资产模型公司 | 月之暗面等 | 主要采购云或合作算力,优化集中于模型与服务层 | 资金集中于模型研发 | 爆款后更容易遭遇供给瓶颈 |

Google与阿里巴巴代表智谱无法复制的全栈起点。Google把TPU、数据中心、JAX、Pathways、Gemini与Vertex AI连在一起,2026年称Pathways已能跨数据中心训练,并纳入全球超过100万颗TPU。[15] 阿里巴巴拥有阿里云、通义千问和平头哥芯片,2026年发布真武M890,并称自研AI芯片已规模生产、进入云基础设施与MaaS推理平台。[16][17] 智谱没有两者长期积累的数据中心、云平台和现金流,现实选择不是拥有全部资产,而是芯片保持多供应商、物理设施通过项目和合作锁定、最贴近模型性能的编译与推理软件收进来——这是一种「选择性全栈」。

OpenAI说明,吉瓦级容量正成为头部模型公司的标准动作,但1GW不能直接横比。Stargate在2025年宣布总规模5000亿美元、目标10GW,至同年9月已公布接近7GW规划容量;2026年6月又在密歇根州为1GW园区破土。[12][13] OpenAI披露了多个项目、伙伴和建设节奏,智谱尚未披露对应细节;国产芯片与国际顶级GPU的每瓦有效算力也不同,机房容量更不等于模型吞吐。真正可比的是组织趋势:两家公司都不再把算力视为随用随买的普通云资源,而是提前锁定长期供给。

Anthropic与智谱都采用多硬件路线,却承担不同的软件成本。Anthropic宣布从2027年起获得数吉瓦下一代TPU容量,同时让Claude运行于AWS Trainium、Google TPU和NVIDIA GPU,并按工作负载选硬件。[14] 它依靠成熟云与芯片伙伴承担大部分底层工作;智谱面对更碎片化的国产生态,必须自己承担更多跨平台编译、算子与运行时适配。因此,中科加禾不是普通的推理优化补丁,而是智谱多芯片策略能否成立的条件之一。

月之暗面展示了轻资产路线的另一面。2026年7月,Kimi K3发布后请求量远超预期,月之暗面一度暂停新增消费者订阅,并称现有集群接近容量极限。[18] 月之暗面依赖外部资源承受爆款后的即时供给瓶颈,智谱则提前锁定容量,以资本和长期承诺换取确定性;若需求低于预期或芯片代际快速变化,同一选择又会带来闲置容量与技术折旧。算力短缺与算力闲置,是同一笔赌注的两面。

多种国产芯片既是供应安全垫,也是软件税。押单一芯片可以优化更深,却承受供应和路线风险;支持多芯片提高采购弹性,却要持续跟进不同的内存、互联、精度、驱动、通信库和工具链。中科加禾能否让公共模块服务多种芯片,同时在智谱最重要的几类平台上接近原生栈性能,是收购后的第一道工程考题。

真正买到的是反馈回路与调度权

智谱过去的选择都带着价格:独立基座模型换来中立性,却失去母公司云;开放模型和MaaS换来开发者与Token增长,也让推理成本成为日常经营压力;兼容40多款芯片换来供应弹性,同时扩大适配矩阵。Google和阿里巴巴从基础设施向上长出模型,智谱则从模型向下扎入基础设施,两条路径方向相反,交汇点都是模型、编译器、芯片、网络和电力共同决定产品能力。

把中科加禾称为「国产CUDA」会夸大这次收购。CUDA包含近二十年的硬件协同、库、工具、文档和开发者生态,一支团队或一次并购无法复制。更准确的说法是,智谱买到了一条更短的反馈回路:模型、部分编译与推理软件进入同一组织后,性能问题的数据与目标可以更快回流,模型团队能提前考虑目标芯片的访存、通信与算子代价,编译团队也能面对真实Token流量和智能体负载,而非抽象benchmark。

这条回路可能把「测试兼容」推进为「生产优化」,但组织风险来自同一处。智谱同时维护模型、MaaS、智能体、企业交付和大规模基础设施;模型按周迭代,机房按年建设,编译器与集群要求长期稳定,一个底层错误又可能让整片集群停摆。这些节奏不会因收购自动一致。

1GW真正稀缺的价值不是一个峰值数字,而是调度权。训练需要连续大块算力,强化学习需要大量并发环境,在线推理需要随时扩容;深度控制的集群可以决定任务抢占、模型常驻、批处理、Prefill-Decode分离,以及如何把训练空档转给推理。只有当中科加禾的软件进入统一调度,资源控制权才可能转成利用率;否则,1GW只是更大的资源池,不一定是更好的计算机。

财务上,智谱正从可变成本转向固定承诺,但项目结构决定风险大小。需求不确定时,服务采购更灵活;需求长期超过供给时,外部服务的溢价和不可控性可能更贵。若项目主要由伙伴投资、智谱按需承购,财务风险较轻;若智谱承担大部分资本开支和最低采购承诺,压力会大得多。公开材料没有披露项目结构,因此现在无法判断这笔账。[1][7]

三个可以验证的未来剧本

最可能的剧本不是「一栈通吃」,而是几类主力国产芯片的深度栈。智谱可能继续维持多芯片兼容,但把工程资源集中到两三类供应稳定、客户接受度高的平台:次要芯片保持可运行,主力芯片深度优化,GLM新版本更快实现Day 0适配。验证指标是国产芯片首发时间差、生产集群Token吞吐与稳定性,以及云端业务毛利率。

最危险的剧本是容量先到,软件、设备和需求没有同步。若芯片、HBM、网络、编译器或模型适配其中一环落后,收购团队又被内部项目分散,集群会出现理论峰值高、实际利用率低;若Token价格同时下降,智谱将以更低价格填充更昂贵的固定容量。预警信号是限流仍在、国产卡上线节奏反复、资本开支或采购承诺上升却未带来云端毛利改善。

最乐观的剧本是形成模型—编译—芯片共同设计。中科加禾参与下一代架构,模型团队按国产芯片的内存与互联选择稀疏结构、并行策略和精度,编译器生成更多后端与融合算子,运行时统一调度训练、强化学习与推理,1GW集群完成规模验证。若成立,优势不只来自更便宜的算力,而是模型设计之初就知道将运行在哪里;这套能力还可能输出给政企客户与主权AI项目。

这个乐观剧本有一项边界:若中科加禾收购后只服务GLM,短期性能可能上升,长期却可能失去跨平台实践和外部客户反馈。共同设计要有价值,仍需发生在足够广的硬件与工作负载上。

结论:1GW是一张考卷,不是答案

这次动作标志着独立模型公司的一个成年时刻:当模型稳定产生大规模Token需求,算力不能只由采购部门管理,编译器也不能只是发布前补齐的工程环节,电力、芯片、软件和模型必须进入同一张产品路线图。

智谱要证明的不是能获得多少电,而是能否把电稳定转化为更高质量、更低成本的Token;不是能否收购一支团队,而是能否让编译与运行时进入模型设计;不是能否兼容更多国产芯片,而是能否在多样性与性能之间形成可持续的工程边界。

未来一年应追踪五组事实:项目已上电容量与芯片构成、GLM在国产卡上的首发和性能数据、中科加禾与智谱平台的整合方式、集群利用率与故障稳定性、智谱云端业务毛利率。它们将回答智谱补上的是一块算力拼图,还是一套可以持续运转的计算系统。

信息来源

1. 第一财经:《智谱落地1GW级算力数据中心建设,全部采用国产AI芯片》(2026-07-21,访问于2026-07-29) 2. 澎湃新闻:《盘中涨超20%!智谱落地1GW级国产AI算力数据中心,完成收购中科加禾》(2026-07-21,访问于2026-07-29) 3. 新京报:《智谱收购中科加禾,并落地1GW级国产AI算力数据中心》(2026-07-21,访问于2026-07-29) 4. 中关村科学城:《智谱收购中科加禾,北京人工智能全栈能力再落关键一子》(2026-07-22,访问于2026-07-29) 5. 智谱官网:关于智谱与发展历程(访问于2026-07-29) 6. 香港交易所:智谱招股章程(2025-12-30,访问于2026-07-29) 7. 香港交易所:智谱截至2025年12月31日止年度业绩公告(2026-03-31,访问于2026-07-29) 8. 机器之心转载页:《打破生态孤岛,国产异构原生AI算力工具问世,来自中科加禾》(2024-07-21,访问于2026-07-29) 9. 2025全球C++及系统软件技术大会:崔慧敏讲者与SigInfer介绍(访问于2026-07-29) 10. 全球计算联盟:《2025年度全球计算产业应用案例汇编》(2025,访问于2026-07-29) 11. 上海证券交易所:寒武纪问询回复(含中科加禾投资与业务信息)(2025-07-25,访问于2026-07-29) 12. OpenAI:Stargate新增五个AI数据中心站点(2025-09-23,访问于2026-07-29) 13. OpenAI:密歇根州1GW数据中心项目(2026-06-01,访问于2026-07-29) 14. Anthropic:与Google、Broadcom扩大数吉瓦计算合作(2026-04-06,访问于2026-07-29) 15. Google:I/O 2026主题演讲与跨数据中心TPU训练基础设施(2026-05,访问于2026-07-29) 16. 阿里巴巴:发布真武M890、Qwen 3.7-Max与重构云栈(2026-05-20,访问于2026-07-29) 17. 阿里巴巴:2026财年董事长及CEO致股东信(2026-05,访问于2026-07-29) 18. TechNode:Kimi K3需求挤压算力并暂停新增订阅(2026-07-20,访问于2026-07-29)

图文卡片 ⬇️ 一键下载图文卡片