GPT‑6 Astra 发布:提升最明显的是长任务和电脑操作
企业使用 AI 处理真实工作时,难点往往出现在连续执行环节。模型要在网页、表格、代码仓库和内部系统之间切换,还要保存几个小时前的操作结果。对话过长会挤掉早期信息,一次工具调用失败也可能让后续步骤全部偏离。传统问答和单轮编码分数,很难反映这类问题。
9 月 3 日,OpenAI 发布 GPT‑6 Astra,首批提供给少量机构,随后覆盖 ChatGPT Plus、Pro、Business、Enterprise,以及 OpenAI API、Azure 和 AWS Bedrock。官方把电脑操作、编码、科研和网络安全列为主要能力区,并为长任务加入跨上下文保存笔记、搜索历史消息和工具结果的机制。
- OpenAI 用电脑操作、业务自动化和终端任务测试 Astra 连续执行工作的能力;
- ARC Prize 另用没有说明书的抽象小游戏,检查模型能否在多轮试错中保留规则。
Astra 在 OSWorld 2.0 得到 72.6%,高于 GPT‑5.6 Sol 的 65.7%;在 ARC‑AGI‑3 中,OpenAI Provider Adapter 得到 99.9%,ARC Prize standard harness 得到 62.7%。harness 是连接模型与测试环境的外部程序,负责传递历史、工具结果和任务状态。两套配置的结果相差超过 36 个百分点。
这次发布值得研究,因为 Astra 的提升没有平均分布在所有测试上。电脑操作、业务自动化和终端任务进步明显,通用综合与部分编码测试仍有强劲对手。ARC‑AGI‑3 的两组结果还表明,同一模型的分数会受 harness 影响。判断 Astra 的实际进步,需要同时看能力提升集中在哪些任务,以及各项成绩使用了什么测试配置。
长任务长期受制于状态保存和工具衔接
普通模型评测通常给出一道题,模型回答后立即计分。
企业工作流更长:填写表单之后还要更新 CRM,修改代码之后还要运行测试,整理日程时还要核对邮件和权限。后续动作依赖前面的结果,早期信息一旦丢失,模型会重复查询、重走失败路径,甚至在错误状态上继续操作。
过去的常见处理方式,是让 Agent 外部程序管理对话和工具。这里的 Agent 指模型与浏览器、终端、文件系统等工具组成的完整执行系统。对话接近模型可读取的长度上限后,外部程序会删除旧消息或压缩成摘要。摘要可以腾出空间,也可能丢掉报错文本、文件位置和一次失败尝试的具体原因。
不同厂商与开发者会使用不同的 harness。harness 负责把任务状态、工具返回和历史消息送给模型,也决定哪些记录会被保留。模型相同,harness 不同,完成率、运行时间和费用都可能变化。Astra 的 ARC‑AGI‑3 结果让这个工程变量变得很具体。
Astra 的主要增量集中在连续电脑操作
OpenAI 给 Astra 选择的测试任务都包含多步操作。
- OSWorld 2.0 要求模型直接使用电脑界面完成工作;
- AutomationBench 覆盖办公与业务自动化;
- Terminal‑Bench 4.0 测量终端环境里的连续执行。
三项测试都要求模型观察结果、决定下一步,并在出错后修正操作。
| 评测 | GPT‑6 Astra | GPT‑5.6 Sol | 实际差异 |
|---|---|---|---|
| OSWorld 2.0 | 72.6% | 65.7% | Astra 完成更多电脑操作任务;官方延迟模拟约为每项 40 分钟,Sol 约为 75 分钟 |
| AutomationBench | 41.4% | 18.1% | 自动化任务完成率提高 23.3 个百分点 |
| Terminal‑Bench 4.0 | 57.9% | 37.3% | 终端任务完成率提高 20.6 个百分点 |
这些结果与 Astra 的状态管理改动相互对应。
- 旧的长任务处理会把早期对话压成摘要;
- Astra 可以把重要信息保存成跨上下文笔记,并搜索更早的消息和工具结果。
模型因此有机会重新找到完整报错和操作记录,减少重复探索。该功能仍处于实验阶段,OpenAI 计划在发布后的几周内把它设为默认。
这项改动主要服务有中间状态的工作。摘要、分类和普通问答通常在一次或少数几次调用内完成,跨上下文笔记带来的帮助有限。需要持续操作浏览器、代码仓库和专业软件的流程,更可能从状态保存中获得收益。
ARC 的两套 harness 结果相差 36 个百分点
ARC‑AGI‑3 使用一组没有说明书的抽象小游戏。
模型需要观察画面、尝试动作、推断目标和规则,再利用前面的发现完成后续关卡。人类参与者可以解决测试中的全部环境,因此该测试重点观察模型能否在多轮试错中形成并保留有效策略。
ARC Prize 用两套 harness 测试了同一个 Astra。
- ARC Prize standard harness 给各厂商模型提供统一接口,便于跨供应商比较;
- OpenAI Provider Adapter 使用 OpenAI 原生请求接口,在相邻请求之间保留推理状态,并由系统处理长对话。
测试配置不同,结果也出现了 36 个百分点以上的差距。
| 运行方式 | 历史信息处理 | 推理档位 | 半私有测试集结果 | 总成本 |
|---|---|---|---|---|
| ARC Prize standard harness | 统一接口;Astra 只能把选中的信息写入可见笔记 | max | 62.7% | 26,098 美元 |
| OpenAI Provider Adapter | 保留 OpenAI 侧推理状态;系统压缩长对话 | high | 99.9% | 18,817 美元 |
62.7% 与 99.9% 回答的是两个问题。
- standard harness 结果更适合比较不同厂商的模型;
- Provider Adapter 结果展示 Astra 使用 OpenAI Responses API 与原生上下文管理时的实验表现。
OpenAI 发布页采用 99.9%,脚注注明测试使用 Responses API harness,并调整了两项通用设置。
Provider Adapter 的高分也没有依靠更多计算。在两套 harness 都完成的 167 个“游戏—推理档位”组合上,Provider Adapter 的总运行时间约为 standard harness 的 27%,token 使用量少 49%。token 是模型读写文本时使用的计费单位。这组对齐结果支持一个具体解释:状态保留减少了重复尝试,模型用更少的时间和文本完成更多关卡。
ARC‑AGI‑3 仍是目标确定、动作可枚举的封闭环境。ARC Prize 明确表示,接近满分不能证明 Astra 达到通用人工智能。现实工作还包括模糊目标、权限变化、脏数据和无法撤销的操作,这些条件没有进入该测试。
通用评测没有显示全面领先
Astra 的其他结果给 99.9% 加上了必要边界。
Artificial Analysis Intelligence Index v4.1.1 中,Astra 得到 61.2 分,GPT‑5.6 Sol 为 60.9 分,Claude Fable 5.1 为 65.7 分。Humanity’s Last Exam 在允许使用工具时,Astra 为 57.2%,Claude Fable 5.1 为 65.0%。DeepSWE 编码测试中,Astra 为 74.1%,GPT‑5.6 Sol 为 72.7%,差距只有 1.4 个百分点。
这些评测与电脑操作结果采用不同任务和评分方式,不能把分数直接相减;它们可以共同说明增量分布。Astra 在电脑使用、自动化和终端任务上提高较多,在通用综合与部分编码项目上没有拉开同等幅度。当前 Artificial Analysis 页面已经更新到 v4.2,Astra max 得分 55、排名第 2,也被列入同价位中偏贵的一档。v4.2 更换了评测套件和计分版本,55 分不能与 v4.1.1 的 61.2 分直接比较;这里保留它只是为了说明最新综合排名仍然没有出现 Astra 全面领先的证据。
企业采用价值因此取决于任务类型。主要需求如果是摘要、分类和普通问答,迁移收益可能有限。工作流需要跨多个软件连续操作,并频繁引用早期结果时,Astra 的完成率和时间优势才可能抵消更高价格。
真实采用还要核算成本、权限和监控中断
Astra API 的标准价格为每百万输入 token 10 美元、输出 token 50 美元,缓存读取为 1 美元、缓存写入为 12.5 美元。
单次输入超过 27.2 万 token 后,整次请求采用更高费率。长任务的动作数、输出长度、缓存命中率和失败重试次数,都会影响一项工作最终花多少钱。
权限限制也会影响自动化效果。Astra 是 OpenAI 首个达到网络安全 Critical 能力阈值的公开部署模型;该等级表示模型具备发现未知漏洞和开发利用方式的高水平能力。官方测试称,Astra 在新近披露的 V8 漏洞集中发现并利用了两个未知漏洞,还完成过浏览器沙箱逃逸、宿主机命令执行和低权限账户提升到 root 的攻击链。
OpenAI 对公开版本施加了更严格的安全控制。模型可以审查和修补安全代码,但会拒绝部分高级漏洞利用请求;获批防御团队可通过 Daybreak 获得更宽的能力范围。监控系统可能减慢、暂停或终止任务,ChatGPT 和 Codex 会请求人工确认,API 请求则可能直接结束。安全概览还记录了一项限制:在专门诱导模型逃避监控的实验里,Astra 比 GPT‑5.6 Sol 更会控制书面推理,只读取推理文本的监控器因此更容易漏报;覆盖完整上下文的监控效果较好,仍未消除全部漏报。
后续验证需要固定模型版本、工具权限和上下文预算,对比现有系统与 Astra 的任务完成率、人工返工时间、P95 延迟、单项任务总成本和正常任务被监控中断的次数。生产环境若使用第三方 harness,还应加入 Responses API 原生配置作为对照。
- 现有证据支持的结论保持有限:99.9% 来自 OpenAI Provider Adapter,该配置使用 Responses API 并保留相邻请求之间的推理状态;
- 62.7% 来自 ARC Prize standard harness,更适合跨供应商比较。
企业能否获得可用增益,要由自身工作流中的完成率、总成本和安全中断率共同决定。