一图版 🏠 返回首页
前沿科技洞见 · 2026-09-22

OpenAI 与 Anthropic 公布 RSI 进度指标:量到的是研发参与深度,不是改进闭环

阅读时间 5 分钟 · 2,978 字 · 基于 7 个来源
背景
9 月 6 日,OpenAI 宣布达成"自动化研究实习生"这一目标。它指一套能在人的指挥下完成界定清楚的研究任务的系统,包括熟练研究员要花几天的任务。12 天后,Anthropic 的政策研究机构 Anthropic Institute 公布三组内部测量。
今日事件
这批数字正在被当作递归自我改进的进度读数。递归自我改进(recursive self-improvement,下文简称 RSI)指模型参与造出更强的下一代模型,而更强的那一代又让下一轮改进更快。

9 月 6 日,OpenAI 宣布达成"自动化研究实习生"这一目标。它指一套能在人的指挥下完成界定清楚的研究任务的系统,包括熟练研究员要花几天的任务。12 天后,Anthropic 的政策研究机构 Anthropic Institute 公布三组内部测量。其中一组称,截至 8 月,Claude 已经"主导"了公司 26% 的 AI 研发工作。两家都在文中呼吁同行定期公布同类数字。

这批数字正在被当作递归自我改进的进度读数。递归自我改进(recursive self-improvement,下文简称 RSI)指模型参与造出更强的下一代模型,而更强的那一代又让下一轮改进更快。但两家公布的每一个指标,分母都是人的工作量或研发活动量,分子都是 AI 占了多少。没有一个指标的分子,是下一代模型多出来的能力。

两家公布了什么

先把两套口径摆清楚,后面的判断都依赖它们量的是什么。

Anthropic 的第一组指标叫研发自动化指数。它用第三方机构 Epoch AI 定的自治分级打分,从 AL0(完全没有 AI 参与)到 AL5(AI 全自主,人不在环里)。AL4 叫"主导",指人给出高层目标、AI 端到端完成大部分工作、人负责监督。截至 8 月,Claude 在 AL4 级别的研发占 26%,2 月这个数字还不到 1%。超过九成的研发至少到了 AL3"协作",没有任何一项达到 AL5。同期公司主力内部平台上同时运行约 3 万个 agent。

OpenAI 给的是另一套数字。到 8 月中,研究组织每投入 1 个人的工作日,agent 一侧运行 3.1 个工作日的量。研究员日均推理花费中位数超过 600 美元,九分位超过 7000 美元。6 月起,agent 总运行时长首次超过人的总工时。

两家用的分类尺子都来自 Epoch AI,但量的东西不同。Anthropic 量任务的自治等级,OpenAI 量 token 花在了哪些研发环节上。同期另外两家没有拿出可比的数字。GoogleGemini 3.8 给出了一套递归评估并改进底层模型的 agent 循环,但没有公布自家研发被 AI 承担到什么程度。马斯克多次说每一代 Grok 由上一代造出来,这是表述,不是口径。所以目前能放在一起读的,只有 OpenAI 和 Anthropic 这两套。

分母是人的工作量,26% 封顶也推不出自我改进

第一条理由在于这些指标能推出什么。

26% 说的是:在多少比例的研发任务上,AI 在人的监督下主导着干。把它推到极限,哪怕这个数字涨到 100%,得到的结论也只是所有研发任务都由 AI 主导着做。它推不出模型自己在变强,因为分母是任务,不是能力。一家公司完全可以 100% 都在 AL4,同时模型的代际进步速度和三年前一样。

这里有个更直接的判据:参与度指标有天花板,递归没有。任何"AI 占了多少"的比例,上限就是 100%。而 RSI 之所以值得单独讨论,正是因为它理论上没有上限,每一轮改进让下一轮更快。用一把有刻度上限的尺子,量不出没有上限的东西。

OpenAI 自己写明了这一点。原文说这些数据相对容易采集、但难以解读,因为它们和研究进展之间的关系并不确定。文中还说,研究过程有很多潜在瓶颈,整体进展速度多半跟不上这些具体指标。

两家自己的数据显示,决定改什么仍在人手里

第二条理由在于环上哪一段被自动化了。

OpenAI 按 Epoch AI 的研发阶段分类,统计 agent 的 token 去向。六个阶段分别是决定做什么、设计、写代码和数据、跑训练和评测、分析、沟通。结果是各类都在涨,但高层规划始终只占 agent 输出 token 极小的一部分。OpenAI 在同一篇里写道:设定研究优先级、判断哪些想法和结果值得继续、决定是否扩大规模或暂停或部署,这些仍然由人来做。

这几句话的位置很关键。RSI 要成立,被接受的改动必须能回头影响下一轮改进怎么生成、怎么评估、怎么筛选。而"决定改什么"正是这个回路合上的地方。按两家自己的数据,这一段恰恰是自动化程度最低的。

任务层面有同样的迹象。OpenAI 说过去半年里,成功完成的 4 到 8 小时任务中,超过一半至少经历了一次人工干预。Anthropic 那边,AL5 全自主一项都没有。

真正在量闭环后半段的,是另一批基准

第三条理由来自同期另一组证据。

字节跳动 Seed 团队 8 月底到 9 月初放出三个基准,量的正好是两家没量的那一段:无人给定目标和答案时,改进能不能留住。

ASPIRE 只给 agent 一句自然语言能力目标,比如"成为更好的物理学家"。下游评测任务对它保密,由它自己决定学什么、怎么更新、何时评估,最后在 520 道专家出题的隐藏题上验收。论文结论是,agent 能例行跑完训练和改 harness 的循环,但权重层面的增益稀少且不稳定。演化出的最强 harness 仍低于人工工程的 Qwen-Agent 参照。局部涨的分数传不到隐藏评测上,继续搜索和训练反而会抹掉先前的改进。

S3Gym 把自测、自评判、自我改进三件事拆开,在七个带可执行判定器的文本游戏里测。结论是认出哪一步做对了并不够,agent 还得把反馈变成可执行、可迁移的策略。参数训练在部分任务上涨幅明显,在另一些任务上不稳定,并出现严重的负迁移。

HarnessDev 让模型从最小种子开始自建一整套执行系统,再用下游反馈迭代改它,在 2207 道隐藏实例上验收。这一篇给出了边界。自建 harness 在代码、搜索与研究上明显落后成熟的人工参照,但在写作和机器学习实验上追平甚至超过。演化确实带来一些提升,但不稳定,只部分迁移到隐藏任务,换一个模型来跑,增益还会大幅变化。

把这三篇和两家实验室的指标对齐着看,分工就清楚了。实验室量的是有人监督时 AI 承担了多深,基准量的是无人监督时改进能不能留住并迁移。前者高,后者弱。两组数字不矛盾,测的是同一条环的不同段。

有一种反驳值得正面回答:1%26% 只用了半年,这个速率本身不就说明有效吗。它说明的是委派速率。委派之所以扩大,只需要 AI 在有人兜底时够用,不需要改进能自己留住。这条线上真正硬的证据是花钱行为。研究员日均烧 600 到 7000 美元推理,内部同时跑 3 万个 agent,这种持续支出比任何自评分数都可信。有监督的 AI 做研发确实到了值得砸钱的规模,但这仍然不是递归。

观察点

这个判断的边界有三层。

其一,两家的数字都是自测,没有第三方核过。Anthropic 的等级由 Claude 当裁判打分,它自己承认裁判模型会犯和被评模型一样的错。模型与员工的评级完全一致率为 59%,而员工之间只有 35%。它还说一周采样只够证明这件事能测、不够说明趋势。它表示计划引入第三方评估者,那是计划不是现状。其二,字节那三篇同样是团队自测,缺独立复现,失败模式是否跨模型跨任务普遍成立还没有定论。其三,HarnessDev 在写作和机器学习实验上的结果说明,改进留不住这件事有适用范围,在评判信号明确的窄任务上不一定成立。

接下来有三件事值得盯。第一件是尺子会不会被其他家接住。OpenAI 在文中说应当要求前沿公司公开追踪 RSI 进度,Anthropic 也说任何前沿开发者都可以定期公布这些指标,并邀请第三方核验。看未来几个季度 Google、xAIMeta 是否在同一把尺子上作答,以及第三方评估者是否真的被接进去。第二件是会不会出现第一个分子为能力增量的指标,也就是把某一代模型的贡献和下一代的能力提升接起来的数字。第三件是 AL5 那一格何时第一次出现非零,以及出现时伴随的是哪一类任务。

信息来源(7)
图文卡片 ⬇️ 一键下载图文卡片