一图版 🏠 返回首页
前沿科技洞见 · 2026-09-15

推理成本的主变量是缓存复用率,不是芯片代际

阅读时间 6 分钟 · 3,574 字 · 基于 11 个来源
背景
过去两年,讨论推理成本的默认框架是芯片:新一代 GPU 出来,每美元算力涨多少,成本就降多少。Epoch AI 对 2006 年以来 470 款 GPU 的统计给出了这条线的斜率:每美元算力大约 2.5 年翻一倍,机器学习专用 GPU 约 2 年翻一倍,折成年率是 32% 到 40%。
今日事件
2026 年 9 月 13 日,DeepSeek 发布 V4.1 Flash 技术报告,把软件层里最大的那一项点了名。
核心判断
中心判断是:对多轮、反复读同一段历史的 Agent 任务,推理成本的主变量是缓存复用率(重复输入里直接从缓存取、不重新计算的比例),不是芯片代际。

过去两年,讨论推理成本的默认框架是芯片:新一代 GPU 出来,每美元算力涨多少,成本就降多少。Epoch AI 对 2006 年以来 470 款 GPU 的统计给出了这条线的斜率:每美元算力大约 2.5 年翻一倍,机器学习专用 GPU 约 2 年翻一倍,折成年率是 32%40%。但同一时期,模型 API 上"达到同一能力水平"的价格下降得远比这快:Gundlach、Lynch、Mertens 和 Thompson 四位作者用 Artificial Analysis 与 Epoch 的数据测算,在知识、推理、数学和软件工程基准上,同等成绩的价格每年下降 5 到 10 倍,其中算法效率一项每年就贡献约 3 倍。芯片只能解释这条下降曲线的一小部分,大头在软件层。

2026 年 9 月 13 日,DeepSeek 发布 V4.1 Flash 技术报告,把软件层里最大的那一项点了名。报告要解决的问题来自 Agent 负载的形态:一个 Agent 任务要跑几十轮,每一轮都把之前的对话、工具输出和文件整段再送进模型,输入 token 远多于输出 token,而且大部分输入和上一轮一样。大模型读入每个 token 都会留下一份中间状态,叫 KV Cache,之后每生成一个字都要回头翻一遍这些状态;输入越长、轮次越多,这些状态占的显存和搬运带宽就越大。报告开篇的判断是:大体积 KV Cache 对 HBM(GPU 上的高速显存)、SSD 容量和传输带宽的压力,"构成进一步降低部署成本的主要瓶颈"。

结果是每个 token 的全局 KV 压到 890 字节,约为上一代 V4 Flash 的四分之一,比早期代际减少 437 倍

中心判断是:**对多轮、反复读同一段历史的 Agent 任务,推理成本的主变量是缓存复用率(重复输入里直接从缓存取、不重新计算的比例),不是芯片代际。

适用范围是输入密集、前缀可复用的 Agent 工作流;长输出、单轮、每次输入都不同的任务不在其中。

同一口径的总账:同等能力的价格每年降 5 到 10 倍,芯片每年只涨三四成

要比较"芯片"和"软件"谁更能决定成本,两边必须用同一把尺子。

年率是唯一能对齐的尺子:芯片侧看每美元算力每年涨多少,软件侧看同等能力的价格每年降多少。Epoch 的 GPU 统计给出芯片侧:每美元浮点算力的翻倍时间是 2.46 年(全部 GPU)到 2.07 年(机器学习 GPU),FP16 精度下 2.30 年,年率 32%40%。那篇论文给出总账:在固定的基准成绩上,API 价格每年下降 5 到 10 倍;论文把这条曲线拆成经济因素、硬件效率和算法效率三项,单独估计算法效率一项为每年约 3 倍。

两个数放在一起,芯片侧每年 1.3 到 1.4 倍,总下降每年 5 到 10 倍,算法效率单项 3 倍,剩余的经济因素(竞争、利润率压缩、利用率)才是硬件之外的另一块。芯片代际不是不重要,而是在这条曲线里排不到第一。同一篇论文还提醒,前沿模型本身的运行价格每年在涨 3 到 18 倍,因为模型更大、推理更长;这和"同等能力的价格在降"是两条线,这里只说后者。

软件侧里最大的一项是缓存:供应商自己这么说

论文里的算法效率是在标准基准上测的总量,没有拆到具体技术项;对 Agent 负载哪一项最大,要看供应商把力气花在哪。

DeepSeek 的技术报告把 KV Cache 写成"进一步降低部署成本的主要瓶颈",并为此重做了模型结构,图 1 里各代模型每 token 全局 KV 字节数的曲线,从早期代际到 V4.1 Flash 减少 437 倍;图 2 显示每生成一个字的计算量随上下文变长几乎不变,意思是对话再长、每个字的成本也不再往上涨。

缓存系统这一侧走的是同一条路。早期做法是每台机器各自缓存自己接到的请求,同一段前缀在同一个节点上最多被存 8 份,请求只能调度到缓存所在的机器。

vLLM 团队 9 月初回放真实 Agent 流量,发现多个 Agent 各自保存相同前缀、每轮对话全量重写缓存两种浪费,改造后两周内 Kimi 模型的高并发吞吐提高了 6 倍以上。这些工作没有一项动了硬件。

定价表把命中率变成了客户账单的主变量

供应商把缓存的成本结构直接写进了价格。

两家公司的官方定价按"未命中价与命中价之比"对齐如下,腾讯一行是媒体在 2026 年 8 月底对 Hy4 preview 的实测报价,是预览版定价,只作参照。

公司与模型未命中输入价(每百万 token)命中价倍数来源与条件
DeepSeek V4.1 Flash0.15 美元(非高峰)0.003 美元50官方定价页,2026-09
DeepSeek V4 Pro0.66 美元(非高峰)0.022 美元30官方定价页,2026-09
Anthropic Claude Fable 5.110 美元0.25 美元40官方文档,5 分钟缓存
Anthropic Claude Opus 5、Sonnet 5、Haiku 4.55、2、1 美元0.5、0.2、0.1 美元10官方文档,5 分钟缓存
腾讯 Hy4 preview6 元0.3 元20媒体实测,2026-08 预览版

用 DeepSeek 的定价页算一笔账。选定 deepseek-flash、非高峰时段,一个每月送入 1 亿输入 token 的 Agent 应用,命中率 50% 时输入账单是 7.65 美元,命中率 90% 时是 1.77 美元,差 4.3 倍。同一张表上,高峰时段所有价格翻倍,时段这个变量是 2 倍。Anthropic 的文档写明,缓存读取的标准价格是基础输入价的 0.1 倍,只有 Fable 5.1 和 Mythos 5.1 按 0.025 倍计价,折扣最深的是最贵的旗舰模型,文档没有解释原因。

硬件侧只有一个弱旁证:Rubin Ultra 用 HBM 容量换单位带宽成本

如果 KV Cache 的容量压力正在被软件和模型结构缓解,硬件设计就不必继续单纯堆高 HBM 容量,而可能把资源转向带宽和单位成本。

SemiAnalysis 9 月 6 日披露,英伟达将 Rubin Ultra 的 HBM 堆叠从 12 层调整为 8 层,容量换成更低的单位带宽成本。这项调整与“缓存压力正在被软件吸收”的推论方向一致,因此可以从硬件侧提供一条独立旁证。

但这不是决定性证据。12 层改为 8 层也可能来自堆叠良率和制造成本,与 KV Cache 需求无关。现有材料无法区分两种解释,因此这条信号只能提高判断的可信度,不能用于证明缓存比芯片更重要,也不能与客户账单或年度降本幅度直接比较。

后续看命中价分层是否保留、企业负载的真实命中率和 Rubin 之后的 HBM 容量

证据的分量不一样。

年率比较还有一处要老实说明:芯片侧的 GPU 统计覆盖 2006 到 2021 年、以每美元浮点算力计,软件侧的价格测算覆盖近两三年、以同等基准成绩的 API 价格计,两组数时间窗不同、口径相近而非相同,能支撑"量级悬殊",不能支撑更精确的倍数。判断只对输入密集、前缀可复用的 Agent 负载成立:一次性写一篇长文、每个问题都不一样的客服问答,输入里没有多少可以复用的内容,命中率再高也省不了几个钱。

接下来两个季度看三个信号。若 DeepSeek 或 Anthropic 取消命中价与未命中价的分层,回到单一输入价,说明缓存成本已被硬件吸收,判断不成立。若 Mooncake 级别的命中率只在 Kimi 这类少数负载上成立,多数企业 Agent 负载的命中率长期低于 50%,则命中率在现实中的杠杆小于芯片代际。若 Rubin Ultra 之后英伟达重新增加 HBM 层数或容量,说明“软件正在吸收 KV 常驻显存压力”这条硬件旁证失效;是否推翻中心判断,仍要结合企业负载的真实命中率和命中价分层判断。

信息来源(11)
图文卡片 ⬇️ 一键下载图文卡片