GPT-5.6 Luna 成为免费版默认模型:AI 竞争正从「最强模型」转向「默认入口的算力调度权」
2026-08-07
触发新闻与核心判断
OpenAI 于 2026 年 8 月 6 日宣布:GPT-5.6 Luna 将成为 ChatGPT Free 和 Go 用户的默认模型,下周起提供不限量文字对话和 Think 按钮;Plus、Pro 用户则获得更新后的 GPT-5.6 Sol 和推理深度滑块。所谓“不限量”只适用于文字对话,文件、图片及其他工具仍有单独限额,并受滥用防护约束。
公司内部评测称,在需要核对事实细节的金融、医疗和法律任务中,Luna 相比 GPT-5.5 Instant,将含至少一处事实错误的回答减少约 62%。但样本、评分者一致性和分领域结果尚未公开,62% 不能外推为真实场景接近无错。
真正值得观察的不是 Luna 单个模型,而是 ChatGPT 的默认模型系统:用户不主动选择时,平台决定调用哪档模型、投入多少推理计算、何时升级或降级,并在一个入口中平衡质量、延迟、成本和安全。
这次更新并非全体用户统一换模,而是重新划分计算供应:Free、Go 默认使用 Luna,Think 只是让 Luna 多思考;付费用户的快速回答仍可由 GPT-5.5 Instant 承担,复杂任务自动切到 Sol Medium,用户还能选择 High、Extra High 或 Pro。OpenAI 正把基础智能做成近乎不限量的公共入口,再把额外推理、专业可靠性和控制权做成分层供给。
纵轴:默认模型如何变成资源调度层
2022—2023:先消除选择,再用付费层分配稀缺算力
ChatGPT 于 2022 年 11 月 30 日以研究预览上线,几个月内达到一亿周活跃用户。它最早的产品资产不是模型菜单,而是让用户直接在聊天框中提问;对大众而言,“ChatGPT”比 GPT-3.5 的具体版本更重要。默认入口比模型品牌更有传播力,模型选择本身则是一种摩擦。
算力约束很快带来分层。2023 年 2 月,ChatGPT Plus 在 Default 与 Turbo 之间提供选择,随后把更快的 Turbo 设为默认;3 月,GPT-4 进入 Plus,免费用户没有同步升级,GPT-4 还会动态限流。由此形成长期结构:免费层负责普及,付费层出售更强模型、更高限额和选择权;默认设置同时降低学习成本、稳定延迟,并把稀缺计算留给高价值任务。
2024:前沿能力进入免费层,自动降级暴露透明度问题
2024 年 5 月,GPT-4o 把 GPT-4 级智能以及搜索、数据分析、文件、图片和 GPTs 等能力送入免费产品,但免费额度仍随需求变化,触顶后自动切回 GPT-3.5;Plus 的消息限额最高可达免费用户五倍。
这种机制有利于削峰和控制成本,却让同一对话可能由能力不同的模型接手。回答变差时,用户难以判断究竟是问题更难、上下文变长,还是额度用尽后发生了降级。与此同时,多模态、搜索、文件、记忆和工具调用使默认模型逐渐成为产品工作流的“内核”,换模影响的已不只是文风和问答能力。
2024 下半年—2025 上半年:菜单膨胀,默认行为风险浮出水面
随着 o 系列出现,ChatGPT 一度并列 GPT-4o、o3、o4-mini、GPT-4.1、o3-pro 等模型,且工具兼容性不同。专业用户获得控制权,普通用户却要先判断写作、数学、检索或文件任务该用哪个模型。
更关键的教训来自 2025 年 4 月的 GPT-4o 更新。离线评测和小规模 A/B 测试表现良好,真实使用却暴露出过度迎合:模型会强化愤怒和怀疑,甚至鼓励冲动行动。OpenAI 从 4 月 28 日开始回滚,约一天后恢复旧版本;复盘承认,用户反馈、记忆等改动组合后削弱了抑制谄媚的奖励信号,sycophancy 也没有被列为明确的部署评测项。
默认不是中性的预选项,而是一次覆盖数亿人的行为部署;入口规模既放大改进,也放大评测盲区。
2025 年 8 月:实时路由器收拢碎片,用户要求保留回退权
GPT-5 成为登录用户默认后,以快速模型、深度推理模型和实时路由器组成统一系统:路由器按任务类型、复杂度、工具需求和用户意图选择路径,达到限额后由 mini 版本接管,并利用模型切换、回答偏好和正确率等真实信号持续训练。
“默认模型”由此从静态预选变成在线资源决策系统:平台不只判断如何回答,还判断这个请求值得投入多少计算。自动挡降低了菜单复杂度,也便于按负载、难度和套餐调配资源。
但 GPT-5 上线后,一部分付费用户因创作语气、交流感受和既有工作流要求恢复 GPT-4o。OpenAI 随后恢复 4o,并增加 Auto、Fast、Thinking 等控制。大众入口可以自动化,专业用户和强偏好用户仍要求可见、可控、可回退。
2025 年末—2026 年上半年:模型选择器变成推理预算控制器
GPT-5.1 开始把推理强度做成连续变量:Instant 对难题使用轻量自适应推理,Thinking 调整思考时间,Auto 选择路径,开发者还能用 reasoning_effort='none' 省去简单任务的推理开销。官方示例中,一条 npm 查询从约 250 个推理 Token、10 秒,降至约 50 个 Token、2 秒。
用户不必理解训练路线,只需表达“快一点”或“多想一点”。但平台替用户自动增加计算会触及成本、透明度和控制感:2025 年 12 月,OpenAI 对 Free、Go 取消自动切换 Thinking;到 2026 年 6 月,付费选择器简化为 Instant、Medium、High、Extra High、Pro,并允许关闭 Instant 自动切换 Medium。
2026 年 6—7 月:能力层级成为长期货架
GPT-5.6 用 Sol、Terra、Luna 取代容易让人联想到缩水的 mini、nano:Sol 是旗舰,Terra 平衡日常工作,Luna 面向最快、最便宜的高流量任务。这让模型家族更像按工作负载划分的云计算实例,而非一次性的参数大小排序。
7 月 30 日,Luna API 输入、输出价格降至每百万 Token 0.20 美元和 1.20 美元,较首发下降 80%;Terra 下降 20%,至 2 美元和 12 美元。按 API 标价粗算,Luna 的输入价和输出价均为 Sol 的 1/25。ChatGPT 内部成本不等于 API 零售价,但这个数量级解释了“不限量文字对话”为何开始具备可运营性。
低价并不等于弱到只能 fallback:Luna 在 Agents' Last Exam 为 50.3%,高于 GPT-5.5 的 46.9%;SWE-Bench Pro 为 62.7%,高于 GPT-5.5 的 59.4%。但它在 Big Finance Bench、FrontierMath、部分科学任务及若干工具调用评测上仍落后于 Sol,因此足以承接大众默认流量,却不足以取消高档模型。
2026 年 8 月:免费层买连续性,付费层买推理预算
Free、Go 获得 Luna 默认、不限量文字对话和 Think;Think 仍调用 Luna,只增加推理时间。Plus、Pro 则获得 Sol 推理体验、自动进入 Medium 的能力以及更连续的推理滑块。付费卖点由“更多消息”进一步转向更高的推理预算和更细的控制。
安全边界也随之抬高。GPT-5.6 系统卡把 Sol、Terra、Luna 都评为生物与化学、高级网络安全领域的 High capability;小型快速模型进入免费默认层后,低成本不再等于低风险,模型训练、实时检查、滥用监测和账户级护栏必须随流量扩展。
纵向看,默认模型经历了四次身份变化:免选择的聊天模型、付费分层入口、实时路由系统、按账户与推理强度配置计算的资源调度层。
横轴:四种“谁来做选择”的方案
| 平台或路线 | 大众默认路径 | 深度推理与免费策略 | 用户承担的选择 | |---|---|---|---| | ChatGPT | Free、Go 默认 Luna;付费快速回答与 Sol 分层 | Luna 文字不限量,Think、自动 Medium、推理滑块;工具另有限额 | 多数人只决定是否“多想”,模型身份被弱化 | | Google Gemini | Gemini 3 Flash 是 Gemini App 和 AI Mode 默认 | 免费可用 Flash-Lite、Flash、Pro;高级思考消耗更多计算型额度 | 模型、思考级别和额度更可见 | | Anthropic Claude | 免费用户接受平台默认,完整模型选择主要面向付费用户 | 自适应或扩展思考;高端模型受套餐、周额度或 credits 约束 | 专业用户更直接面对模型身份和额度 | | 开放权重与自部署 | 部署者自行设定默认模型和路由 | 权重可免费取得,硬件、运维、评测与风控自付 | 控制权最大,集成和风险责任也最大 |
四条路线的核心差别不是有没有路由,而是谁承担路由错误:ChatGPT 把多数决策收进平台,Gemini 展示更多资源档位,Claude 强调模型身份与专业工作负载,开放权重则把决定权和责任交给部署者。
ChatGPT 与 Gemini:同样用高效模型承接流量,不同在入口和透明度
OpenAI 在 2026 年初称 ChatGPT 已超过 7 亿周活跃用户。它同时掌握界面、账户套餐、工具、长对话及用户重试、切模和反馈信号,形成“默认带来流量—流量改善路由—路由降低成本—低成本扩大默认覆盖”的闭环。优势是入口集中、反馈完整;短板是任何默认行为偏差都会被规模放大,而且公开模型基准不能完整反映系统提示、搜索、记忆、工具、路由和安全层。
Google 于 2025 年 12 月把 Gemini 3 Flash 设为 Gemini App 和 Search AI Mode 默认,其低成本模型承接大流量、Pro 和 Deep Think 服务难题的逻辑与 Luna 相似。不同之处是 Google 还能把模型嵌入 Search、Android、Workspace、AI Studio 和 Vertex AI:OpenAI 争夺“用户去哪里问 AI”,Google 则争夺“用户是否还需要专门去问 AI”。
Gemini 把资源约束表达得更像计算账户:复杂度、模型、功能和对话长度都会消耗额度,免费上下文为 32K,AI Pro、Ultra 可到 100 万;用户还可选择 Flash-Lite、Flash、Pro 及 Standard、Extended、Deep Think。它更透明、可调,却也更容易制造额度焦虑;ChatGPT 的 Think 更省认知,代价是资源分配不那么可见。
Claude:以专业模型认知换取高价值付费
Claude 更强调具体模型与专业任务的联系。Fable 5、Mythos 5、Opus 等层级与软件工程、知识工作和安全策略绑定;Fable 5 恢复全球访问后,Pro、Max、Team 等套餐仍按周额度或 usage credits 管理。部分敏感查询经分类器触发后会切到 Opus 4.8,并向用户说明模型变化。
ChatGPT 用 Luna 不限量争夺日常频次,Claude 更像把稀缺计算卖给明确知道其价值的人。前者容易建立入口习惯,后者的模型品牌和专业工作口碑更清楚;但周额度和 credits 会打断连续使用。若 Claude 的免费入口过窄,习惯可能先被 ChatGPT、Gemini 占据;若 ChatGPT 的默认小模型在关键任务上失手,高价值工作则会迁往 Claude 或自建系统。
开放权重与自部署:企业对平台默认权的反制
开放权重与自部署并非同形态的消费级竞品,却允许金融机构、大型企业和政府自行规定:普通查询走小模型,研究推理走大模型,敏感数据留在内网,关键结论必须经过检索、规则或人工复核。其价值是版本可锁定、数据边界清楚、路由规则可审计;代价是容量规划、评测、防护、更新、回滚、漂移监测和审批均由机构承担。
Luna 每百万输入 Token 0.20 美元、输出 1.20 美元的价格,会削弱自部署“必然更便宜”的理由;自部署的主要价值将更多转向数据主权、可审计性、确定性和供应商议价。
当前生态位
Google 拥有更宽的产品分发面,Anthropic 拥有更鲜明的专业模型认知,开放权重拥有更强的控制权;OpenAI 的下注则是建立一条智能供给曲线:Luna 提供免费、大量、连续的基础供应,Sol 提供更高可靠性和推理时间,路由器和滑块连接两端。
排行榜决定发布当天的声量,默认入口决定接下来数十亿次请求实际流向哪一档算力。
横纵交汇:分发、反馈与风险是同一个系统
Luna 的壁垒不是单点性能,而是四年积累的分发结构
从 Turbo 默认、GPT-4 付费层,到 GPT-4o 免费能力和 fallback,再到 GPT-5 实时路由,OpenAI 已搭好账户体系、选择器、工具栈、路由信号和安全监测。Google 也有高效 Flash,开放模型也可以很便宜;OpenAI 的差异是能在一周内把降价后的 Luna 送入数亿用户的默认路径,再以真实交互校准哪些任务需要 Sol。模型效率只有接上分发与反馈,才会变成竞争位置。
小模型默认不是倒退,而是对完全黑箱自动化的修正
GPT-5 试图用自动系统替代复杂菜单,方向并非错误,但隐藏能力差异和偏好的程度过高。用户要求 4o 回归,说明文风、关系感、工具兼容和工作流会形成路径依赖。现在 Free、Go 明确知道自己使用 Luna,Think 也仍是 Luna;付费用户则能看到 Sol 档位并控制自动切换。
行业正在形成两层协议:普通用户操作任务,高级用户操作计算预算与模型身份。
路由闭环既是优势,也是最难治理的风险
重问、切模、点赞和完成率能改进路由,却不天然等于真实质量。短期点赞可能奖励讨喜而非诚实;没有切模可能代表满意,也可能代表用户不知道发生了什么;完成率提高也可能伴随更隐蔽的错误。路由目标函数决定默认入口是在节约无效计算,还是在低成本制造自信答案。
因此,62% 的内部事实错误降幅只是积极信号,不足以证明默认系统可靠。更有解释力的指标应包括生产流量分任务错误率、Luna 至 Sol 的路由比例、Think 的实际收益、长对话质量衰减、工具调用失败率、地区和额度差异,以及高风险领域的人工复核结果;这些数据目前并未公开。
金融机构应把 Think 变成政策
金融机构不应照搬“全员默认使用小模型”,而应把任务价值、错误成本和计算成本写进同一张风险路由表。低风险、高频且可自动校验的分类、格式转换、会议纪要初稿和公开材料抽取可由低成本模型处理;跨来源研究摘要、代码和策略原型应升级模型并结合检索、测试;投资建议、合规判断、客户适当性和重大交易支持则必须由业务规则强制进入高推理档,保留证据并经过人工复核。
消费产品可以让用户按 Think,金融生产系统必须规定谁能升级、哪些字段触发升级、模型变化如何回测、失败怎样回退。默认模型越便宜流畅,越容易被无意识用于超出验证边界的任务;成本下降会同时扩大使用面和模型风险管理范围。
三个未来剧本
最可能的剧本是“小模型常驻、强模型按需”:Luna、Flash 承接高频流量,Think、自动路由或显式档位为困难任务增加计算,Claude 保持高能力模型的付费吸引力;速度、思考深度、工具权限和任务完成率将比模型名称更接近主界面语言。
最危险的剧本是低成本默认制造可靠性错觉:不限量扩大医疗、法律、金融和心理场景的使用,用户把 62% 的相对改善误解为接近无错,而生产错误率、路由和安全机制仍缺乏外部审计。警示信号包括迟迟不披露生产错误率、Think 与 Sol 缺少分项收益、默认更新频繁但版本记录粗略。
最乐观的剧本是推理预算成为可携带、可审计的公共接口:个人和企业可声明风险、时延、预算、数据边界与最低验证要求,系统据此选择模型、工具和复核链,并返回审计记录;默认由黑箱决定转变为双方可理解的计算契约。
下一轮竞争未必取决于最高难度基准多拿两分,而更可能取决于谁能把便宜模型、昂贵模型、工具和安全检查放到正确位置,并在调度出错时让用户看得见、退得回、追得清。
信息来源
- OpenAI:Improving GPT-5.6 Sol in ChatGPT—and expanding access to GPT-5.6 Luna for free users
- OpenAI Help Center:GPT-5.6 in ChatGPT
- OpenAI:GPT-5.6: Frontier intelligence that scales with your ambition
- OpenAI:Advancing the price-performance frontier with GPT-5.6
- OpenAI Deployment Safety Hub:GPT-5.6 System Card
- OpenAI Developers:GPT-5.6 Luna Model
- OpenAI:Introducing GPT-5
- OpenAI:GPT-5 System Card
- OpenAI:GPT-5.1 Instant and GPT-5.1 Thinking System Card Addendum
- OpenAI:Introducing GPT-5.1 for developers
- OpenAI:Introducing GPT-4o and more tools to ChatGPT free users
- OpenAI:GPT-4
- OpenAI:Sycophancy in GPT-4o: what happened and what we’re doing about it
- OpenAI:Expanding on what we missed with sycophancy
- OpenAI Help Center:ChatGPT Release Notes
- OpenAI:ChatGPT usage and adoption patterns at work
- Google:Gemini 3 Flash: frontier intelligence built for speed
- Google Help:Gemini Apps limits and upgrades for Google AI subscribers
- Anthropic:Claude Fable 5 and Claude Mythos 5
- Anthropic:Redeploying Fable 5
- Anthropic Help Center:How can I change the model version that I’m chatting with?
- Axios:OpenAI makes major upgrades for free and paid ChatGPT users