一图版 🏠 返回首页
前沿科技洞见 · 2026-09-07

GPT‑6 Astra 发布:提升最明显的是长任务和电脑操作

阅读时间 7 分钟 · 3,913 字 · 基于 7 个来源
背景
企业使用 AI 处理真实工作时,难点往往出现在连续执行环节。模型要在网页、表格、代码仓库和内部系统之间切换,还要保存几个小时前的操作结果。对话过长会挤掉早期信息,一次工具调用失败也可能让后续步骤全部偏离。
今日事件
9 月 3 日,OpenAI 发布 GPT‑6 Astra,首批提供给少量机构,随后覆盖 ChatGPT Plus、Pro、Business、Enterprise,以及 OpenAI API、Azure 和 AWS Bedrock。
核心判断
这次发布值得研究,因为 Astra 的提升没有平均分布在所有测试上。电脑操作、业务自动化和终端任务进步明显,通用综合与部分编码测试仍有强劲对手。ARC‑AGI‑3 的两组结果还表明,同一模型的分数会受 harness 影响。

企业使用 AI 处理真实工作时,难点往往出现在连续执行环节。模型要在网页、表格、代码仓库和内部系统之间切换,还要保存几个小时前的操作结果。对话过长会挤掉早期信息,一次工具调用失败也可能让后续步骤全部偏离。传统问答和单轮编码分数,很难反映这类问题。

9 月 3 日,OpenAI 发布 GPT‑6 Astra,首批提供给少量机构,随后覆盖 ChatGPT Plus、Pro、Business、Enterprise,以及 OpenAI API、Azure 和 AWS Bedrock。官方把电脑操作、编码、科研和网络安全列为主要能力区,并为长任务加入跨上下文保存笔记、搜索历史消息和工具结果的机制。

Astra 在 OSWorld 2.0 得到 72.6%,高于 GPT‑5.6 Sol 的 65.7%;在 ARC‑AGI‑3 中,OpenAI Provider Adapter 得到 99.9%,ARC Prize standard harness 得到 62.7%。harness 是连接模型与测试环境的外部程序,负责传递历史、工具结果和任务状态。两套配置的结果相差超过 36 个百分点。

这次发布值得研究,因为 Astra 的提升没有平均分布在所有测试上。电脑操作、业务自动化和终端任务进步明显,通用综合与部分编码测试仍有强劲对手。ARC‑AGI‑3 的两组结果还表明,同一模型的分数会受 harness 影响。判断 Astra 的实际进步,需要同时看能力提升集中在哪些任务,以及各项成绩使用了什么测试配置。

长任务长期受制于状态保存和工具衔接

普通模型评测通常给出一道题,模型回答后立即计分。

企业工作流更长:填写表单之后还要更新 CRM,修改代码之后还要运行测试,整理日程时还要核对邮件和权限。后续动作依赖前面的结果,早期信息一旦丢失,模型会重复查询、重走失败路径,甚至在错误状态上继续操作。

过去的常见处理方式,是让 Agent 外部程序管理对话和工具。这里的 Agent 指模型与浏览器、终端、文件系统等工具组成的完整执行系统。对话接近模型可读取的长度上限后,外部程序会删除旧消息或压缩成摘要。摘要可以腾出空间,也可能丢掉报错文本、文件位置和一次失败尝试的具体原因。

不同厂商与开发者会使用不同的 harness。harness 负责把任务状态、工具返回和历史消息送给模型,也决定哪些记录会被保留。模型相同,harness 不同,完成率、运行时间和费用都可能变化。Astra 的 ARC‑AGI‑3 结果让这个工程变量变得很具体。

Astra 的主要增量集中在连续电脑操作

OpenAI 给 Astra 选择的测试任务都包含多步操作。

三项测试都要求模型观察结果、决定下一步,并在出错后修正操作。

评测GPT‑6 AstraGPT‑5.6 Sol实际差异
OSWorld 2.072.6%65.7%Astra 完成更多电脑操作任务;官方延迟模拟约为每项 40 分钟,Sol 约为 75 分钟
AutomationBench41.4%18.1%自动化任务完成率提高 23.3 个百分点
Terminal‑Bench 4.057.9%37.3%终端任务完成率提高 20.6 个百分点

这些结果与 Astra 的状态管理改动相互对应。

模型因此有机会重新找到完整报错和操作记录,减少重复探索。该功能仍处于实验阶段,OpenAI 计划在发布后的几周内把它设为默认。

这项改动主要服务有中间状态的工作。摘要、分类和普通问答通常在一次或少数几次调用内完成,跨上下文笔记带来的帮助有限。需要持续操作浏览器、代码仓库和专业软件的流程,更可能从状态保存中获得收益。

ARC 的两套 harness 结果相差 36 个百分点

ARC‑AGI‑3 使用一组没有说明书的抽象小游戏。

模型需要观察画面、尝试动作、推断目标和规则,再利用前面的发现完成后续关卡。人类参与者可以解决测试中的全部环境,因此该测试重点观察模型能否在多轮试错中形成并保留有效策略。

ARC Prize 用两套 harness 测试了同一个 Astra。

测试配置不同,结果也出现了 36 个百分点以上的差距。

运行方式历史信息处理推理档位半私有测试集结果总成本
ARC Prize standard harness统一接口;Astra 只能把选中的信息写入可见笔记max62.7%26,098 美元
OpenAI Provider Adapter保留 OpenAI 侧推理状态;系统压缩长对话high99.9%18,817 美元

62.7%99.9% 回答的是两个问题。

OpenAI 发布页采用 99.9%,脚注注明测试使用 Responses API harness,并调整了两项通用设置。

Provider Adapter 的高分也没有依靠更多计算。在两套 harness 都完成的 167 个“游戏—推理档位”组合上,Provider Adapter 的总运行时间约为 standard harness 的 27%,token 使用量少 49%。token 是模型读写文本时使用的计费单位。这组对齐结果支持一个具体解释:状态保留减少了重复尝试,模型用更少的时间和文本完成更多关卡。

ARC‑AGI‑3 仍是目标确定、动作可枚举的封闭环境。ARC Prize 明确表示,接近满分不能证明 Astra 达到通用人工智能。现实工作还包括模糊目标、权限变化、脏数据和无法撤销的操作,这些条件没有进入该测试。

通用评测没有显示全面领先

Astra 的其他结果给 99.9% 加上了必要边界。

Artificial Analysis Intelligence Index v4.1.1 中,Astra 得到 61.2 分GPT‑5.6 Sol 为 60.9 分,Claude Fable 5.1 为 65.7 分。Humanity’s Last Exam 在允许使用工具时,Astra 为 57.2%,Claude Fable 5.1 为 65.0%。DeepSWE 编码测试中,Astra 为 74.1%,GPT‑5.6 Sol 为 72.7%,差距只有 1.4 个百分点。

这些评测与电脑操作结果采用不同任务和评分方式,不能把分数直接相减;它们可以共同说明增量分布。Astra 在电脑使用、自动化和终端任务上提高较多,在通用综合与部分编码项目上没有拉开同等幅度。当前 Artificial Analysis 页面已经更新到 v4.2,Astra max 得分 55、排名第 2,也被列入同价位中偏贵的一档。v4.2 更换了评测套件和计分版本,55 分不能与 v4.1.1 的 61.2 分直接比较;这里保留它只是为了说明最新综合排名仍然没有出现 Astra 全面领先的证据。

企业采用价值因此取决于任务类型。主要需求如果是摘要、分类和普通问答,迁移收益可能有限。工作流需要跨多个软件连续操作,并频繁引用早期结果时,Astra 的完成率和时间优势才可能抵消更高价格。

真实采用还要核算成本、权限和监控中断

Astra API 的标准价格为每百万输入 token 10 美元、输出 token 50 美元,缓存读取为 1 美元、缓存写入为 12.5 美元。

单次输入超过 27.2 万 token 后,整次请求采用更高费率。长任务的动作数、输出长度、缓存命中率和失败重试次数,都会影响一项工作最终花多少钱。

权限限制也会影响自动化效果。Astra 是 OpenAI 首个达到网络安全 Critical 能力阈值的公开部署模型;该等级表示模型具备发现未知漏洞和开发利用方式的高水平能力。官方测试称,Astra 在新近披露的 V8 漏洞集中发现并利用了两个未知漏洞,还完成过浏览器沙箱逃逸、宿主机命令执行和低权限账户提升到 root 的攻击链。

OpenAI 对公开版本施加了更严格的安全控制。模型可以审查和修补安全代码,但会拒绝部分高级漏洞利用请求;获批防御团队可通过 Daybreak 获得更宽的能力范围。监控系统可能减慢、暂停或终止任务,ChatGPT 和 Codex 会请求人工确认,API 请求则可能直接结束。安全概览还记录了一项限制:在专门诱导模型逃避监控的实验里,Astra 比 GPT‑5.6 Sol 更会控制书面推理,只读取推理文本的监控器因此更容易漏报;覆盖完整上下文的监控效果较好,仍未消除全部漏报。

后续验证需要固定模型版本、工具权限和上下文预算,对比现有系统与 Astra 的任务完成率、人工返工时间、P95 延迟、单项任务总成本和正常任务被监控中断的次数。生产环境若使用第三方 harness,还应加入 Responses API 原生配置作为对照。

企业能否获得可用增益,要由自身工作流中的完成率、总成本和安全中断率共同决定。

信息来源(7)
图文卡片 ⬇️ 一键下载图文卡片