前沿科技日报 · 2026-09-07
Agent 的竞争从模型能力转向支架、工作流与受控执行
2026-09-07 前沿科技洞见 · 日报
过去 24 小时的新增材料把 Agent 的工程重心指向模型之外:OpenAI 首次披露内部研究人员每天调用 3.1 个“Agent 工作日”,ServiceNow 用自动搜索支架让固定模型提高 20—35 分,亚马逊则把跨会话记忆、并行调度、失败重试和安全控制整合进开源工作台。具身与科研方向也在压缩数据和算力门槛,VLAct 用 16 张 GPU 训练可跨动作头迁移的底座,Axiom Math 借助并行计算与形式化验证刷新素数间隔上界。金融科技侧,三条公链接连停机暴露紧急权限差异,基金公司的 Skill 工作流开始进入投研、交易和合规环节。
📊 今日关键数据
- 3.1 个 Agent 工作日:OpenAI 研究人员平均每个自然工作日调用的 Agent 工作量;重度用户 Token 支出超过 7000 美元/日(来源:OpenAI 数据摘要)
- 92.5%:VLAct 在 RoboTwin 2.0 的成功率,持续预训练使用 16 张 GPU(来源:机器之心)
- 20—35 分:StarHarness 在企业基准上为固定模型带来的性能增量,推理成本最多下降 53%(来源:HuggingPapers)
- 212:Axiom Math 报告的新有界素数间隔上界,原约六天的数值实验被压缩至数小时(来源:Lingowhale 专题)
- 14.8GW:媒体汇总的 Anthropic 已签约算力容量下限,未来十年支出估算最高 5170 亿美元(来源:Techmeme / The Information 摘要)
🔍 今日值得深读
OpenAI 研究人员每天调用 3.1 个“Agent 工作日”
OpenAI 称内部编码 Agent 已达到“自动化研究实习生”目标:研究人员平均每个自然工作日使用 3.1 个 Agent 工作日,重度用户单日 Token 成本超过 7000 美元。这组早期数据把科研 Agent 的价值衡量从单次答题分数推进到实验吞吐、任务复杂度和人机并行程度。
- 发生了什么:编码 Agent 已进入 OpenAI 的研究流程,并以并行工作量而非聊天次数统计使用强度。
- 为什么值得深读:它提供了前沿实验室内部使用 Agent 的首批量化参照,也暴露出高强度自动化所需的真实算力成本。
- 后续看点:实验完成速度、有效研究产出、失败返工率能否随 3.1 倍并行工作量同步改善,以及高额 Token 支出能否下降。
VLAct 用 16 张 GPU 训练跨动作头迁移的 VLA 底座
StarVLA 团队发现,继续预训练后在原动作头上变强,并不代表视觉语言底座更通用:RoboTwin 中 OFT 头成功率由 61.7% 升至 75.8%,换成 PI 和 GR00T 头却分别降至 55.1% 和 28.9%。VLAct 通过保护视觉编码器与浅层语言层、混入图像描述数据,并用 OFT、PI、GR00T 多头共同监督来减轻这种“动作头特异性表征坍塌”。
- 发生了什么:模型用开源数据和 16 张 GPU 完成持续预训练,RoboTwin 2.0 成功率达到 92.5%;面对未见过的 GR-1 机器人,只用 20% 下游数据便超过 GR00T N1.6 的全量数据基线。
- 为什么值得深读:研究把 VLA 的优化对象从固定策略成功率改成可跨任务、动作头和机器人复用的底座表征,直接对应机器人轨迹昂贵且难扩充的问题。
- 后续看点:开源模型在真实机器人、长程任务和不同硬件形态上的复现结果,以及 20% 数据优势是否能跨数据集保持。
来源:机器之心
ServiceNow 自动搜索 Agent 支架,固定模型提高 20—35 分
StarHarness 不微调模型,而是围绕固定模型搜索更合适的 Agent 支架。在企业基准上,搜索后的支架带来 20—35 分提升,同时把推理成本最多降低 53%;在 ITBench 上,小型开放权重模型搭配演化支架,比 GPT-5.5 使用默认支架高 19.2 分。
- 发生了什么:研究把提示、工具调用与控制流程组成的支架作为可优化对象,在保持模型不变的条件下搜索配置。
- 为什么值得深读:结果说明模型选型并非 Agent 性能的唯一主变量,支架优化可能同时改善正确率和成本。
- 后续看点:搜索预算、训练与测试隔离方式、不同企业任务上的迁移性,以及支架对异常恢复和安全边界的影响。
S3Gym 显示大模型自测、自评并不会稳定带来自我改进
字节跳动 Seed 用七种文本游戏评测模型能否通过自测和自评持续改进。结果具有明显任务依赖性:没有一种记忆方案在所有游戏中占优,参数训练还可能产生负迁移,因此“模型生成经验—判断经验—再次训练”的闭环不能被视为自动升级机制。
- 发生了什么:S3Gym 把自我改进拆成测试、评价、记忆与参数更新,并在七类交互环境中比较效果。
- 为什么值得深读:它把递归改进从概念判断落到可重复实验,并明确给出跨任务不稳定和负迁移两类失败边界。
- 后续看点:论文公布的各模型基线、评价器可靠性与重复运行方差,以及记忆更新和参数训练何时应停止。
Axiom Math 用并行搜索与验证把素数间隔上界推进至 212
Axiom Math 报告将有界素数间隔上界从长期纪录 246 推进至 212。团队沿用 Stadlmann 的解析思想,用分布式数值实验搜索积分区域和参数组合,并以 Python 与 Lean 辅助验证;一次原需约六天的数值实验,经并行化、预计算和特征值求解优化后缩短到数小时。
- 发生了什么:约两周的混合团队项目找到直径为 212 的 45 元 admissible tuple,并形成可供人阅读的论文与形式化验证材料。
- 为什么值得深读:新增不只是数学结果,也展示了 Agent、数值计算与形式化证明如何组成研究流水线。
- 后续看点:212 结果的同行核验,以及材料所述 OpenAI 186 结果能否公开完整证明并获得数学界确认。
三条公链四天内停机,回滚、暂停出块与事后停机边界不同
Cronos、Ontology 与 ICON 在四天内先后停止出块,但调用的紧急权限并不相同:Cronos 通过验证节点共识回滚部分链历史,Ontology 只暂停新交易确认,ICON 则在多数涉事 ICX 已进入交易所托管账户后停机。停机这一表象背后,对最终性和资产处置的影响差异很大。
- 发生了什么:三条链分别用回滚、暂停出块和事后停机处理攻击或异常;Cronos 的回滚只能控制本链状态,无法撤回已跨链转移的资产。
- 为什么值得深读:事件把“去中心化网络的紧急开关”具体化为验证节点协调、历史改写、结算暂停和跨链资产不可控四个边界。
- 后续看点:各链是否公布完整事故报告、验证节点表决记录、最终损失与恢复后的重组保护措施。
来源:吴说 Real
📰 独立报道
AGI、Agent 与评测
亚马逊开源 Kiro Crew,补齐长程编码任务的控制层
Kiro Crew 把跨会话记忆、多 Agent 并行、任务调度、失败重试与安全控制放进同一工作空间,支持本地或远程无值守运行,并用规范文档约束需求、设计和任务拆解。项目采用 Apache 2.0 许可证,前身 MeshClaw 已有超过 3.9 万名开发者使用;实际边界包括较快的 Token 消耗以及长程任务仍需人工审查。
Anthropic 电商 Agent 采用单主模型与按需 Skill
Claude Commerce Agents 的公开架构避免按业务域频繁切换子 Agent,改用保留完整对话状态的单一主模型和按需加载 Skill;高频能力进入系统提示,长尾功能动态注入,商品卡片等 UI 则封装成结构化工具。材料给出的现场数据为购物车容量增加 35%、购买概率增加 60%,但仍需结合商户样本和实验口径解读。
来源:华尔街见闻
RLVR 研究转向过程验证、混合信号、自验证与标准编译
一份技术综述梳理 2026 年验证器扩展路线:二元对错奖励无法表达部分正确,在 GRPO 同组响应全对或全错时也不给出有效相对梯度;开放写作与对话又缺少唯一答案。当前研究分别从验证中间过程、混合奖励来源、让模型参与验证,以及把开放标准编译成可执行规则四个方向补足覆盖面。
来源:机器之心
Qwen3.8-Next 用 6B 激活参数匹配 397B 前代模型
阿里披露 Qwen3.8-Next:总参数 125B、每次激活 6B,组合 Gated DeltaNet、稀疏注意力与 n-gram embedding。材料称其以约前代三分之一的激活参数和九分之一 FLOPs,匹配 397B 参数前代模型,并改善训练稳定性;完整消融与稳定性分析随论文发布。
Puro-2B 在 RTX 5090 上以低于 5090 美元完成训练
Puro-2B 给出一套消费级 GPU 小模型训练配方:2B 参数模型在 RTX 5090 上完成训练,总成本低于 5090 美元,材料称性能可匹配 Qwen2-1.5B。数据、代码、权重和论文同步开放,使成本核算、数据配方和训练过程可被外部复查。
NVIDIA Scal3R 用冻结底座重建公里级三维序列
Scal3R 面向在线长序列三维重建,在冻结底座上只增加约 1% 参数,支持公里尺度序列;材料称模型可在单张 GPU 上用 8 小时完成训练。论文、项目页和代码入口均已发布,后续应重点比较长序列累计漂移、实时吞吐与不同相机条件下的精度。
Editable Visual Design 让生成海报保留文本与分层编辑能力
该方法让编码 Agent 调用 VLM 负责设计推理、图像模型负责视觉模拟,输出包含真实文本、解耦图层和可编辑结构的海报与信息图,而非单张不可修改的位图。项目还提供逐步设计回放,便于检查 Agent 的布局与修改过程。
AI 战略与工程
AI BioDesign 获 9460 万美元,建立实验—模型闭环
Allen Institute、华盛顿大学与 Fred Hutch 联合启动五年期 AI BioDesign 项目,62 人团队将围绕蛋白质、DNA 调控元件和细胞功能定向生成实验数据,再由模型提出下一轮设计与实验。项目总投入 9460 万美元,承诺开放成果,并要求 18—24 个月内给出首批可验证进展。
来源:DeepTech 深科技
中国首款 AI 辅助研发原创药获附条件批准
盐酸伊司特韦片获国家药监局附条件批准,用于成人轻型、中型新冠病毒感染治疗。西湖大学、西湖实验室与西湖制药称,这是国内首款借助 AI 从源头发现并最终获批的原创药,从发现到完成临床试验历时三年半;公开快讯未披露 AI 在靶点、分子筛选和临床环节的具体贡献比例。
来源:华尔街见闻
Anthropic 签约算力规模据估至少 14.8GW
The Information 的汇总分析称,Anthropic 自去年 10 月以来签署的算力协议至少达到 14.8GW,未来十年相关支出可能高达 5170 亿美元。该数字是媒体依据多笔协议作出的估算,不是公司财务指引;决策价值在于它给出了前沿模型公司电力、云资源与资本承诺的数量级。
资管金融与区块链
基金公司把 Skill 扩展到投研、交易与合规工作流
财联社调查显示,基金公司的 AI 应用正从接入模型和知识库转向员工自建 Skill 与 Agent。易方达澄清“上千个公开 Skill”说法不准确:内部 EWork 的公开 Skill 覆盖投研、交易等环节,另有大量仅个人或小组使用的工具,无法准确统计。变化重点是可复用工作流进入业务系统,而不是 Skill 数量。
来源:财联社
英国 FCA 与平台接触,研究调整金融预测市场限制
英国 FCA 据报已与交易平台接触,讨论是否放宽金融类预测市场限制,但尚未正式解禁。现行规则仍可能把相关合约视作禁止向零售用户销售的二元期权;体育和政治事件则可能归博彩委员会管辖。后续需看 FCA 是否发布正式咨询或规则文本,以及金融与非金融事件如何划界。
SEC 拟更新过户代理规则以适配代币化证券
美国证券市场的过户代理规则正面临数十年来的重要更新,讨论范围覆盖电子记录、分布式账本和代币化证券如何进入股权登记、变更与公司行动流程。现阶段应关注正式提案对链上记录法律效力、过户代理责任、系统韧性和投资者资产核对的具体要求,而不能把规则更新等同于代币化证券全面获准。
来源:数字财经趋势
BIS 区分稳定币与代币化存款的货币属性
BIS 总经理 Pablo Hernández de Cos 的杰克逊霍尔讲话以怀俄明州公共稳定币 FRNT 为切口,讨论稳定币与代币化存款如何在数字账本上延伸货币功能。材料强调创新不能脱离货币的统一性、可兑换性和受监管中介责任,技术形式相似并不代表两类负债拥有相同信用基础。
来源:通证经济
硬件与算力
TCS 规划 74 亿美元 AI 数据中心园区
印度 TCS 计划建设占地 264 英亩的 AI 数据中心园区,项目金额约 74 亿美元,并采用液冷基础设施。公开材料尚未给出供电规模、芯片配置与投产节奏;这些指标将决定该园区是通用托管能力,还是面向大模型训练和推理的高密度算力设施。
来源:Tech in Asia