🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-08-27

智谱开源 GLM-5.3-Flash:旗舰级智能降到 Claude Opus 4.8 约 1/40 的价格,国产芯片首次扛起全球推理流量

正在发生的事很多,这件帮你看过了

发生了什么

2026 年 8 月 26 日晚,智谱认领此前在 OpenCode 与 OpenRouter 匿名测试的模型 Ox-Alpha(社区称「牛来」),并以 GLM-5.3-Flash 开源。它总参数 320B、激活参数 18B,在 Artificial Analysis 智能指数上拿到 57 分,与 Anthropic 的 Claude Opus 4.8 持平;定价为 GLM-5.3 的十分之一,限时半价后约为 Claude Opus 4.8 输出价的四十分之一。

它是 GLM-5 系列首个原生多模态轻量旗舰开源模型,支持文本、图像、视频输入和 1M 上下文,通过「稀疏注意力 + 线性注意力」混合架构把旗舰级智能压进轻量价位。每百万 token 输入 0.8 元、输出 2.8 元、缓存命中 0.23 元,上线前两周再半价,9 月 9 日结束。模型已以 zai-org/GLM-5.3-Flash 在 Hugging Face 开源,API 上线 BigModel 与 Z.ai,ZCode 同步接入。

匿名测试的六天

智谱第二次走「先匿名免费、再官方认领」的路径:春节前夕的 Pony Alpha 事后被证实是 GLM-5,这次 Ox-Alpha 沿用同一节奏。8 月 20 日 Ox-Alpha 在 OpenRouter、OpenCode 上线,免费且无厂商署名。

据 AI信息Gap 汇总的第三方平台数据,6 天内它在 OpenRouter 消耗 23.2 万亿 token,第二名 DeepSeek-V4-Flash 为 9.9 万亿;在 OpenCode 消耗 43 万亿 token,断层第一。社区用分词器指纹完成识别:25 组提示词下,Ox-Alpha 与 GLM-5.3 每次返回的 token 数只差固定 75 个,开源工具 modelprint 的 95 次对比全部命中智谱。有开发者从 DeepSWE 抽 10 个任务测试,通过率 80%,高于 Claude Fable 5 与 GPT-5.6 Sol。谷歌 DeepMind 研究员曾暗示指向 Gemini,官方认领后被社区以「GLM,Google Language Model」调侃回敬。

钱从哪里省出来

1/40 的价格不是补贴,而是成本结构下移。相比 GLM-5.3,GLM-5.3-Flash 把激活参数从 32B 降到 18B、层数从 92 层减到 45 层,注意力计算量约为前代三分之一,KV 缓存不到四分之一;这是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型。同时,Ox-Alpha 测试期间全部流量运行在超 10 万张国产芯片组成的集群上,端到端性能较初始基线提升 3 倍,单 token 成本已与主流英伟达 GPU 相当。

把价格放回中国模型市场的时间线:Kimi K3 输出价曾达每百万 token 100 元;智谱上半年提价后输出价 28 元。8 月 DeepSeek 全面提价,V4 Pro 从 6 元涨到 13.5 元(高峰 27 元),V4 Flash 输出从 2 元涨到谷时 4.5 元、高峰 9 元,理由是算力稀缺。结果 OpenCode 上 V4 Flash 调用量掉了约一半。GLM-5.3-Flash 落在弧线最低处,常规调用综合成本低于调价后的 DeepSeek V4 Flash;海外输出价 0.5 美元,而 Claude Opus 4.8 官方输出价 25 美元。

同一档智能里的对手

Artificial Analysis 智能指数 v4.1.1 的散点图上,57 分附近站着不同出身的产品:Claude Opus 4.8 同为 57 分、输出 25 美元/百万 token;Claude Sonnet 5、Qwen3.8 Max、GPT-5.6 Terra 与 GLM-5.3-Flash 分数相近,单个任务成本分别约为 3 美元以上、1.2 美元和 0.5 美元。同样接近 57 分的智能,价格差出十几倍到六十几倍。智谱想在这条「同价位最聪明、同智能最便宜」的帕累托前沿上占据成本最低点。

直接对手是 DeepSeek V4 Flash:参数规模接近(320B 对约 300B),智谱口径下 57 分高于 DeepSeek 旗舰 V4 Pro 正式版的 53 分。7 月 31 日 DeepSeek 靠「每百万输出 token 2 元」画过斩杀线,OpenCode 上单日调用量一度突破 8 万亿 token;8 月提价后让出的需求缺口被免费的 Ox-Alpha 接住。调价后的 V4 Flash 谷时价为 1.5/4.5/0.05 元,缓存命中仍比 GLM-5.3-Flash 便宜,但常规输入输出综合成本更高。

同一天发布的 Qwen3.8-Flash-Next 架构预览(125B 总参数、6B 激活,混合注意力 + n-gram embedding)显示「极致稀疏 + 混合注意力」已是下一代开源轻量模型的共同方向。往外一层,OpenAI 同日公布自研推理芯片 Jalapeño 首测:每瓦吞吐为 GB200/GB300 的 1.5–1.9 倍,DeepSeek R1 端到端延迟 1.65 秒对 GB300 的 5.99 秒。英伟达则用 Groq 3 LPX 的 SRAM 方案和 Vera Rubin 平台回应;苹果用 2nm M6 和 M5 Ultra 抬高本地大模型推理的硬件规格。三条降本路线——模型架构稀疏化、专用推理芯片、端侧统一内存——同日形成完整对照,智谱是其中唯一把「架构 + 国产算力」两条腿并在一起的公司。

三个判断

第一,降价有工程支撑,市场对价格有真实弹性。架构减半加国产芯片降本,让 1/40 的价格由两项工程变化支撑,而非烧钱换份额;DeepSeek 提价后 V4 Flash 调用量在 OpenCode 减半,说明「智能需求没有弹性」的判断被证伪——一旦有人能在 57 分档位持续供货,调用量就会迁移。

第二,国产算力在旗舰级推理上第一次从「可用」走到「平价」。超 10 万张国产卡承接全部免费测试流量、端到端性能提升 3 倍、单 token 成本与英伟达 GPU 相当,合起来是一个可复用的推理部署方案。公开材料没有披露具体芯片型号,《晚点 LatePost》称供应商或来自华为、摩尔线程与海光,智谱未评论;10 万卡集群的长期稳定性、故障率和软硬件生态仍是后续验证点。

第三,匿名测试加开源正在成为智谱固定的发布与圈地机制。两次重复说明路径已固定:免费换真实调用量和口碑,分词器指纹和社区「破案」负责传播,官方认领收口,开源权重把生态引向自家 API 和云。这比传统发布会更快建立价格锚。

后续信号

可观察四个具体信号:9 月 9 日半价结束后价格与调用量是否回落;DeepSeek 是否再度调价或放出下一代轻量模型;国产芯片集群的型号披露;Hugging Face 开源权重的下游微调生态。

信息来源

1. AI信息Gap:刚刚,智谱开源 GLM-5.3-Flash!牛真的来了 2. AI信息Gap:刚刚,智谱认领「牛来」!DeepSeek 惨遭斩杀 3. 华尔街见闻全球:智谱推出对标 DeepSeek 的轻量旗舰模型,由 10 万国产卡支持 4. 腾讯研究院:AI 速递 20260827 5. APPSO:OpenAI 自研「辣椒芯片」首测超英伟达,会让 ChatGPT 更便宜吗?

图文卡片 ⬇️ 一键下载图文卡片