OpenAI 的三层定价带:Astra、Sol、Luna 价差拉开 5 到 100 倍,降价没换来基准分下滑
9 月 22 日,OpenAI 在 GPT-6 Astra 之下补齐 Sol 和 Luna。标准 API 输出价由此排成每百万 Token 50、10 和 0.50 美元三档。三款模型不只是性能高低不同,它们把同一家供应商的智能拆成了相差 5 倍至 100 倍的价格带。原来“重要任务默认上旗舰、其他任务再谈降级”的选型习惯需要倒过来:先按任务复杂度找最低可用档,只有验证不通过时才向上升级。
这次变化之所以值得在现在重估,是因为便宜并没有在综合基准上对应同幅度的能力损失。9 月 29 日,OpenAI 又以同样的 2/10 美元价格用 GPT-6.1 Sol 替换原始 Sol。独立评测中,它与 Astra 的 Intelligence Index 只差 1 分。Intelligence Index 是综合多项基准测出的模型能力总分,分数越高代表综合能力越强。价格层级没有因中档变强而收窄,OpenAI 反而把“能力继续迭代、档位价格保持不动”做成了更清楚的产品结构。
三档价格对应三种任务预算
三层结构先回答了成本差异到底有多大。
按 OpenAI 当前标准 API 价,三款模型的输入价分别是 10、2、0.10 美元。输出价分别是 50、10、0.50 美元。也就是说,Astra 对 Sol 贵 5 倍,对 Luna 贵 100 倍;这两个倍数在输入和输出两端都成立。
| 当前型号 | 每百万输入 / 输出 Token | 官方定位 | 更合适的起始任务 |
|---|---|---|---|
| GPT-6 Astra | 10 / 50 美元 | 最复杂、要求最高的工作 | 高风险研究、复杂推理、难以复核的关键结论 |
| GPT-6.1 Sol | 2 / 10 美元 | 接近 Astra 的日常复杂工作 | 编码 Agent、多步业务流程、复杂文档处理 |
| GPT-6 Luna | 0.10 / 0.50 美元 | 大规模日常工作 | 摘要、抽取、分类和边界清楚的批量任务 |
这张表首先改变默认模型,增加折扣选项只是次要结果。一次调用若有 20 万输入 Token 和 2 万输出 Token,可先忽略缓存与工具费用。Astra、Sol、Luna 的标价成本约为 3、0.60 和 0.03 美元。同一工作流每天运行一万次,三档对应的日成本就是约 3 万、6000 和 300 美元。任务能否下沉一档,比在同一档里压缩几个百分点的 Token 更能改变预算。
价格带也覆盖了长上下文的重复使用。当前缓存输入价为 Astra 1 美元、Sol 0.10 美元、Luna 0.01 美元。Agent 反复携带规则、代码库摘要或客户资料时,中档相对旗舰的缓存价差达到 10 倍。这个差距是标准输入价差的两倍。因此,路由规则需要同时记录任务难度和上下文复用率,不能只看一次请求的输入输出单价。
从 GPT-5.6 到 GPT-6,降价来自服务效率而非缩短答案
纵向变化解释了这次分层为何不像一次促销。
- OpenAI 先在 9 月 3 日发布 Astra,把旗舰价定在 10/50 美元;
- 9 月 22 日再发布 Sol 和 Luna。
Sol 从 GPT-5.6 的 4/20 美元降到 2/10 美元,Luna 从 0.20/1.20 美元降到 0.10/0.50 美元。OpenAI 明确把降价归因于缓存和推理基础设施改进,而 GPT-5.6 的对照价本身已经是促销价。
独立结果支持“降价没有换来综合能力缩水”,而模型并没有因此少说。Artificial Analysis 在最大推理档测得,原始 Sol 跑一次综合评测平均花 1.06 美元,上代为 1.99 美元。Artificial Analysis 是一家独立的第三方 AI 基准测评机构。Luna 则从 0.18 美元降到 0.07 美元。两款新模型每项任务的输出 Token 反而略多,Sol 为 3.1 万对 2.9 万,Luna 为 5.1 万对 4.1 万。成本下降主要来自单价,没有靠缩短推理和答案制造表面节省。
同推理档位的比较也没有出现综合分回撤。Sol 在 high 档的 Intelligence Index 都是 42 分,Luna 则从上代的 32 分升至 33 分。GPT-6.1 Sol 又把最大档综合分推到 52,Astra 为 53。两者每项综合评测任务的平均成本分别是 0.72 和 3.26 美元。中档在一周内变强、标价不变,进一步强化了按任务出售智能的结构。
综合分相近,不代表三个模型可以互换
横向比较给出了价格分层真正的使用边界。
Artificial Analysis 的 Intelligence Index 汇总十项知识、推理、编码和工作流评测。它适合观察总体成本效率,却不能替代机构自己的错误成本。原始 GPT-6 Sol 的 Coding Agent Index 比上代高 2 分,但 Luna 低 2 分。Coding Agent Index 是专门衡量编码类智能体任务表现的基准测试。Luna 在 SWE-Atlas-QnA 和 DeepSWE 上也分别下降 5 个和 2 个百分点。SWE-Atlas-QnA 和 DeepSWE 都是衡量软件工程任务表现的基准测试。低价档适合批量任务,不等于它已经是低价版 Astra。
原始 Sol 的知识工作结果同样有结构性取舍。它在 GDPval-AA 上约下降 100 Elo,Luna 下降约 75 Elo;评测者把退步归因于交付物更短、遗漏评分要求。GDPval-AA 是一项评估知识工作交付质量的基准测试。两款模型的幻觉率虽然下降,但 Sol 也把回答率从 99% 降到 83%,以更多拒答换取更少错误。金融机构若只统计“回答中有多少错”,可能把拒答、遗漏和人工补做的成本漏掉。
当前 GPT-6.1 Sol 缩小了这部分差距,却没有消除任务差异。在最大推理档,它的 Intelligence Index 只比 Astra 低 1 分。AutomationBench 仍是 65% 对 68%,Terminal-Bench 4.0 是 56% 对 59%。AutomationBench 和 Terminal-Bench 4.0 都是衡量自动化任务执行能力的基准测试。在高风险法律检索、投研结论或要求完整覆盖检查项的流程里,这几分可能对应不同的复核量。可自动验收的编码和文档流水线则不同,5 倍标价差更可能超过这几分的价值。
因此,模型路由不能只写成“简单、一般、困难”三个标签。任务应按错误代价、可验证性、上下文复用和吞吐量拆分。可自动验收且高频的任务从 Luna 起跑,长链编码和多步流程从 Sol 起跑。错误难以及时发现或后果不可逆的任务,才从 Astra 起跑。升级条件应取自本机构评测中的失败类型,供应商排序只作参考。
观察价差能否延续,也要观察流量是否真的下沉
最强反证落在企业实际用量上:它可能仍然集中在 Astra。
如果 Sol 和 Luna 需要更多重试、人工复核或向上回退,100 倍 Token 价差未必能转成端到端成本差。OpenAI 目前没有公布三档 API 的流量迁移数据。公开评测也无法覆盖每家机构的专有数据、工具和合规规则。因此,“按价格带选型”是新的默认假设,不能取代采购前评测。
接下来有三个可验证节点。第一,下一代发布时,Astra 对 Sol 和 Luna 的 5 倍、100 倍标准价差是否继续保留。若迅速收窄,这更像阶段性获客。第二,GPT-6.1 Sol 在第三方知识工作与金融任务中,能否同时维持接近 Astra 的完成率和综合分。第三,企业网关中的首选流量、回退率和人工复核时长是否一起下沉。只有三项同时变化,价格分层才真正变成需求分层。
在这些数据出现前,最稳妥的判断已经可以改变。Astra 只应担任三层路由中的高风险兜底,不宜继续充当 OpenAI 能力的默认入口。CIO/CTO 的采购对象应包含一套路由规则,用本地评测把任务稳定分配到 Luna、Sol 和 Astra。
信息来源(8)
- OpenAI:Introducing GPT-6 Sol and Luna
- OpenAI:Introducing GPT-6.1 Sol
- OpenAI API:GPT-6 Astra 模型与定价
- OpenAI API:当前价格表
- Artificial Analysis:GPT-6 Sol 与 Luna 的成本效率和细分回退
- Artificial Analysis:GPT-6.1 Sol 替换 GPT-6 Sol 后的独立评测
- Artificial Analysis:GPT-6.1 Sol 与 GPT-6 Astra 同口径比较
- Artificial Analysis:GPT-6 Luna 与 GPT-5.6 Luna 同档比较