推理成本的主变量是缓存复用率,不是芯片代际
过去两年,讨论推理成本的默认框架是芯片:新一代 GPU 出来,每美元算力涨多少,成本就降多少。Epoch AI 对 2006 年以来 470 款 GPU 的统计给出了这条线的斜率:每美元算力大约 2.5 年翻一倍,机器学习专用 GPU 约 2 年翻一倍,折成年率是 32% 到 40%。但同一时期,模型 API 上"达到同一能力水平"的价格下降得远比这快:Gundlach、Lynch、Mertens 和 Thompson 四位作者用 Artificial Analysis 与 Epoch 的数据测算,在知识、推理、数学和软件工程基准上,同等成绩的价格每年下降 5 到 10 倍,其中算法效率一项每年就贡献约 3 倍。芯片只能解释这条下降曲线的一小部分,大头在软件层。
2026 年 9 月 13 日,DeepSeek 发布 V4.1 Flash 技术报告,把软件层里最大的那一项点了名。报告要解决的问题来自 Agent 负载的形态:一个 Agent 任务要跑几十轮,每一轮都把之前的对话、工具输出和文件整段再送进模型,输入 token 远多于输出 token,而且大部分输入和上一轮一样。大模型读入每个 token 都会留下一份中间状态,叫 KV Cache,之后每生成一个字都要回头翻一遍这些状态;输入越长、轮次越多,这些状态占的显存和搬运带宽就越大。报告开篇的判断是:大体积 KV Cache 对 HBM(GPU 上的高速显存)、SSD 容量和传输带宽的压力,"构成进一步降低部署成本的主要瓶颈"。
- 做法是把模型按缓存体积反推设计:把模型拆成编码器和解码器两段,解码器要用的"全局 KV"(每一步生成都必须常驻显存的那部分缓存)由编码器的输出投影得到;
- 跨层复用同一份 KV;
- 缓存用 FP4(4 位精度)存储。
结果是每个 token 的全局 KV 压到 890 字节,约为上一代 V4 Flash 的四分之一,比早期代际减少 437 倍。
中心判断是:**对多轮、反复读同一段历史的 Agent 任务,推理成本的主变量是缓存复用率(重复输入里直接从缓存取、不重新计算的比例),不是芯片代际。
- ** 三条证据在各自口径上指向同一方向:按年率算,软件侧的成本下降是芯片侧的好几倍;
- 软件侧里,供应商自己把缓存定义为主要瓶颈;
- 在客户账单上,命中率从 50% 提到 90% 能把输入费用压到四分之一。
适用范围是输入密集、前缀可复用的 Agent 工作流;长输出、单轮、每次输入都不同的任务不在其中。
- 比较线: 年率口径下,同等能力的价格每年降 5 到 10 倍,算法效率每年 3 倍,GPU 每美元算力每年涨 32% 到 40%。
- 演进线: 缓存从单机显存里的优化项,变成 Moonshot 的集群级共享池,再到 DeepSeek 把模型结构按缓存体积反推设计。
- 边界线: 年率总账、客户账单与硬件设计信号承担不同作用:前两者支撑结论,Rubin 的 HBM 变更只是可被其他原因解释的旁证。
同一口径的总账:同等能力的价格每年降 5 到 10 倍,芯片每年只涨三四成
要比较"芯片"和"软件"谁更能决定成本,两边必须用同一把尺子。
年率是唯一能对齐的尺子:芯片侧看每美元算力每年涨多少,软件侧看同等能力的价格每年降多少。Epoch 的 GPU 统计给出芯片侧:每美元浮点算力的翻倍时间是 2.46 年(全部 GPU)到 2.07 年(机器学习 GPU),FP16 精度下 2.30 年,年率 32% 到 40%。那篇论文给出总账:在固定的基准成绩上,API 价格每年下降 5 到 10 倍;论文把这条曲线拆成经济因素、硬件效率和算法效率三项,单独估计算法效率一项为每年约 3 倍。
两个数放在一起,芯片侧每年 1.3 到 1.4 倍,总下降每年 5 到 10 倍,算法效率单项 3 倍,剩余的经济因素(竞争、利润率压缩、利用率)才是硬件之外的另一块。芯片代际不是不重要,而是在这条曲线里排不到第一。同一篇论文还提醒,前沿模型本身的运行价格每年在涨 3 到 18 倍,因为模型更大、推理更长;这和"同等能力的价格在降"是两条线,这里只说后者。
软件侧里最大的一项是缓存:供应商自己这么说
论文里的算法效率是在标准基准上测的总量,没有拆到具体技术项;对 Agent 负载哪一项最大,要看供应商把力气花在哪。
DeepSeek 的技术报告把 KV Cache 写成"进一步降低部署成本的主要瓶颈",并为此重做了模型结构,图 1 里各代模型每 token 全局 KV 字节数的曲线,从早期代际到 V4.1 Flash 减少 437 倍;图 2 显示每生成一个字的计算量随上下文变长几乎不变,意思是对话再长、每个字的成本也不再往上涨。
缓存系统这一侧走的是同一条路。早期做法是每台机器各自缓存自己接到的请求,同一段前缀在同一个节点上最多被存 8 份,请求只能调度到缓存所在的机器。
- Moonshot 为 Kimi 服务设计的 Mooncake 系统把 KV Cache 从单张 GPU 的显存、单机内存扩展为整个集群共享的资源池,并把预填充(把整段输入一次算完)和解码(逐字生成)拆到不同机器上;
- 2024 年的论文描述了架构,2026 年 9 月披露的生产数据是命中率稳定超过 90%。
vLLM 团队 9 月初回放真实 Agent 流量,发现多个 Agent 各自保存相同前缀、每轮对话全量重写缓存两种浪费,改造后两周内 Kimi 模型的高并发吞吐提高了 6 倍以上。这些工作没有一项动了硬件。
定价表把命中率变成了客户账单的主变量
供应商把缓存的成本结构直接写进了价格。
两家公司的官方定价按"未命中价与命中价之比"对齐如下,腾讯一行是媒体在 2026 年 8 月底对 Hy4 preview 的实测报价,是预览版定价,只作参照。
| 公司与模型 | 未命中输入价(每百万 token) | 命中价 | 倍数 | 来源与条件 |
|---|---|---|---|---|
| DeepSeek V4.1 Flash | 0.15 美元(非高峰) | 0.003 美元 | 50 | 官方定价页,2026-09 |
| DeepSeek V4 Pro | 0.66 美元(非高峰) | 0.022 美元 | 30 | 官方定价页,2026-09 |
| Anthropic Claude Fable 5.1 | 10 美元 | 0.25 美元 | 40 | 官方文档,5 分钟缓存 |
| Anthropic Claude Opus 5、Sonnet 5、Haiku 4.5 | 5、2、1 美元 | 0.5、0.2、0.1 美元 | 10 | 官方文档,5 分钟缓存 |
| 腾讯 Hy4 preview | 6 元 | 0.3 元 | 20 | 媒体实测,2026-08 预览版 |
用 DeepSeek 的定价页算一笔账。选定 deepseek-flash、非高峰时段,一个每月送入 1 亿输入 token 的 Agent 应用,命中率 50% 时输入账单是 7.65 美元,命中率 90% 时是 1.77 美元,差 4.3 倍。同一张表上,高峰时段所有价格翻倍,时段这个变量是 2 倍。Anthropic 的文档写明,缓存读取的标准价格是基础输入价的 0.1 倍,只有 Fable 5.1 和 Mythos 5.1 按 0.025 倍计价,折扣最深的是最贵的旗舰模型,文档没有解释原因。
硬件侧只有一个弱旁证:Rubin Ultra 用 HBM 容量换单位带宽成本
如果 KV Cache 的容量压力正在被软件和模型结构缓解,硬件设计就不必继续单纯堆高 HBM 容量,而可能把资源转向带宽和单位成本。
SemiAnalysis 9 月 6 日披露,英伟达将 Rubin Ultra 的 HBM 堆叠从 12 层调整为 8 层,容量换成更低的单位带宽成本。这项调整与“缓存压力正在被软件吸收”的推论方向一致,因此可以从硬件侧提供一条独立旁证。
但这不是决定性证据。12 层改为 8 层也可能来自堆叠良率和制造成本,与 KV Cache 需求无关。现有材料无法区分两种解释,因此这条信号只能提高判断的可信度,不能用于证明缓存比芯片更重要,也不能与客户账单或年度降本幅度直接比较。
后续看命中价分层是否保留、企业负载的真实命中率和 Rubin 之后的 HBM 容量
证据的分量不一样。
- 年率总账来自那篇论文和 Epoch 的公开统计,定价表、DeepSeek 技术报告和 Anthropic 文档是官方一手材料;
- Mooncake 90% 的命中率和 vLLM 6 倍的吞吐是媒体和分析机构转述的,跑的是什么负载没有公开。
年率比较还有一处要老实说明:芯片侧的 GPU 统计覆盖 2006 到 2021 年、以每美元浮点算力计,软件侧的价格测算覆盖近两三年、以同等基准成绩的 API 价格计,两组数时间窗不同、口径相近而非相同,能支撑"量级悬殊",不能支撑更精确的倍数。判断只对输入密集、前缀可复用的 Agent 负载成立:一次性写一篇长文、每个问题都不一样的客服问答,输入里没有多少可以复用的内容,命中率再高也省不了几个钱。
接下来两个季度看三个信号。若 DeepSeek 或 Anthropic 取消命中价与未命中价的分层,回到单一输入价,说明缓存成本已被硬件吸收,判断不成立。若 Mooncake 级别的命中率只在 Kimi 这类少数负载上成立,多数企业 Agent 负载的命中率长期低于 50%,则命中率在现实中的杠杆小于芯片代际。若 Rubin Ultra 之后英伟达重新增加 HBM 层数或容量,说明“软件正在吸收 KV 常驻显存压力”这条硬件旁证失效;是否推翻中心判断,仍要结合企业负载的真实命中率和命中价分层判断。
信息来源(11)
- DeepSeek:DeepSeek-V4.1-Flash 技术报告,2026-09
- DeepSeek:API 定价页(含高峰与缓存命中价)
- Anthropic:Prompt caching 定价文档
- Gundlach、Lynch、Mertens、Thompson:The Price of Progress,arXiv 2511.23455
- Epoch AI:Trends in GPU price-performance
- Epoch AI:How persistent is the inference cost burden
- Mooncake:A KVCache-centric Disaggregated Architecture for LLM Serving,arXiv 2407.00079
- 量子位:Mooncake 将 KV Cache 池化,生产命中率超过 90%,2026-09-12
- SemiAnalysis:vLLM 针对 Agent 流量改造 KV 缓存,Kimi 吞吐提升 6 倍,2026-09-04
- SemiAnalysis:Rubin Ultra HBM 由 12-Hi 调整为 8-Hi,2026-09-06
- 光子星球:腾讯 Hy4 preview 实测与定价,2026-08-30