前沿科技日报 · 2026-09-04
前沿模型竞争从单次能力分数转向长程执行可靠性,世界模型与推理系统同步补齐“持续工作”能力
2026-09-04 前沿科技洞见 · 日报
过去 24 小时的新增信息集中在三个层面:GPT-6 Astra 把电脑操作、长程工程任务与网络安全能力推到新的部署门槛;Agent 研究开始直接评测运行支架、跨年度经营和重复执行稳定性,而非只看单次答案;世界模型、机器人和推理基础设施则围绕长时状态、失败恢复与实时交互继续收敛。
📊 今日关键数据
- 63% / 99%:GPT-6 Astra 在 ARC-AGI-3 使用标准支架与 provider adapter 的得分,支架改变带来 36 个百分点差异(来源:ARC Prize)
- 超过 20B token、低于 6 美元/小时:Latent.Space 对 Astra 覆盖模型训练、数据标注、部署调试和子 Agent 编排的工程压力测试规模与报告成本(来源:Latent.Space)
- 超过 6 倍:vLLM 团队两周内取得的 Kimi 高并发推理吞吐提升(来源:SemiAnalysis)
- 82%:Facet-0 在五项真实计算机装配任务的平均成功率,对比 π0.5 的 10% 和 GR00T N1.7 的 4%(来源:机器之心)
- 12 万小时、77.8%:ZimaBlue 的视频预训练规模与真实机器人零样本成功率,基线为 36.1%(来源:HuggingPapers)
- 1.9 倍:台积电设备需求从去年底到今年 7 月相对基准的增幅水平(来源:华尔街见闻)
🔍 今日值得深读
GPT-6 Astra 上线,ARC-AGI-3 标准支架得分 63%,安全能力首次达到 Critical
OpenAI 向 Daybreak 客户首批开放 GPT-6 Astra,并将其定位为电脑操作与编码模型。ARC Prize 用标准支架测得 ARC-AGI-3 得分 63%;换用保留不透明推理并做上下文压缩的 provider adapter 后得分升至 99%,说明支架设计本身显著影响长程评测。官方同时披露,Astra 是其首个按 Preparedness Framework 达到网络安全 Critical 级别的广泛部署模型。
- 发生了什么:Astra 的训练使用得州 Stargate 超过 10 万颗 GPU;ARC-AGI-2 达到 95.0%,成本 1.12 美元/题,另一配置以 0.28 美元/题追平 98.5% 高分。API 定价为每百万输入 token 10 美元、输出 token 50 美元。
- 为什么值得深读:标准支架与 provider adapter 相差 36 个百分点,揭示长程 Agent 能力不能脱离记忆保留、压缩方式和工具接口单独比较;安全分级又使能力上线与访问控制成为同一个工程问题。
- 后续看点:Daybreak 客户的真实任务成功率、Critical 级网络能力的访问范围与监控机制,以及不同支架在同等 token、延迟和成本约束下能否复现 99%。
来源:OpenAI 发布报道 · ARC Prize 评测 · OpenAI 安全说明 · 训练规模 · 定价
E-Commerce Bench 让 Agent 用 10 万元经营网店 365 天,几乎没有模型学会持续改进
阿里千问发布长程自主经营评测 E-Commerce Bench。Agent 以 10 万元初始资金运营网店一年,连续处理采购、谈判、定价、促销、库存、退货与现金流,市场由真实电商数据驱动。
- 发生了什么:环境包含 6,886 种商品、576 家供应商,其中 152 家为欺诈供应商;每个经营日限时 600 分钟,并计入仓储费、退货和信誉。评测除年末资产外还覆盖六个维度。
- 为什么值得深读:它把 Agent 从短任务成功率推进到资本约束、对手风险和跨周期策略学习;结果显示没有单一模型在七个维度全面领先,几乎没有模型在一年中学会降低采购价或持续改进策略。
- 后续看点:各模型的破产率、欺诈识别率、资金周转效率,以及引入持久记忆或在线学习后能否形成可重复的年度改进曲线。
来源:阿里千问
Facet-0 在五项计算机装配任务平均成功率 82%,失败恢复率升至 81%
南洋理工大学 PINE Lab 发布面向接触丰富型精密操作的机器人基础模型 Facet-0,在 RAM、CPU、硬盘和 GPU 等真实装配任务中联合使用视觉、语言、本体状态与六维力觉。
- 发生了什么:五项任务含 23 个子目标和 0.10—0.30 毫米装配间隙;Facet-0 平均成功率 82%,对比 π0.5 的 10% 和 GR00T N1.7 的 4%,放置精度 0.5 毫米、指令延迟约 50 毫秒。ManuFacet-1K 提供约 1,000 小时力同步示范与闭环运行数据。
- 为什么值得深读:训练从预训练成功率 16% 提升至 RL 后训练 38%,再经轻量适配达到 82%;部署后失败恢复率由 44% 升至 81%,表明保留失败、接管和恢复轨迹比只扩充成功示范更接近制造需求。
- 后续看点:跨机箱、零件公差和机械臂平台的泛化结果,以及长期运行中的卡滞恢复次数、零件损伤率和人工接管率。
来源:机器之心
EASE 用 12.7 万条证据框监督视觉注意力,三种 VLM 平均提升 2.5—3.1 个百分点
哈工大、中关村学院等团队提出 EASE,把证据区域转换为视觉 token 的平滑目标分布,在多模态 RLVR 训练时监督回答 token 应关注的位置,推理阶段无需额外标注或计算分支。
- 发生了什么:团队构建约 12.7 万条带证据框数据,以 GPT-4.1-mini 抽取证据、grounding 模型定位,再由 Gemini 2.5 Flash-Lite 独立验证;在 Qwen2.5-VL-7B、Qwen3-VL-4B、Qwen3-VL-8B 上,相对 outcome-only 的 DAPO 基线平均提升 2.9、3.1、2.5 个百分点,并覆盖 11 个基准。
- 为什么值得深读:HallusionBench-Image 诊断显示注意力与证据目标的 KL 散度越大,幻觉率越高(ρ=0.34,p<0.001),把“答对但没看对”从直觉问题变成可测量的感知信用分配问题。
- 后续看点:证据框自动标注误差对收益的影响、无框数据上的迁移能力,以及注意力对齐是否会牺牲需要全局上下文的问题。
来源:机器之心
STATE 用逾 2.67 亿单细胞数据训练,跨细胞扰动预测较基线提升超过 30%
Arc Institute 团队在《Cell》发表虚拟细胞模型 STATE,并推出 Cell-Eval 标准化评测套件,目标是根据细胞当前状态和药物或基因干预预测后续状态,尤其处理未见细胞环境的泛化。
- 发生了什么:State Embedding 使用约 1.67 亿个人类单细胞数据学习状态表示;Transformer 架构的 State Transition 再用超过 1 亿个受干预单细胞数据学习群体变化。评测覆盖小分子药物、细胞因子刺激和 CRISPR 基因敲除三类数据。
- 为什么值得深读:大型数据集上,STATE 区分扰动效应的能力较多种基线提升超过 30%;对未见过“曲美替尼处理 C32 黑色素瘤细胞”的组合,也优于简单均值基线,直接触及虚拟细胞长期受制于跨环境失效的问题。
- 后续看点:Cell-Eval 上各基线的完整分项、不同实验批次噪声下的稳定性,以及预测结果进入湿实验后能减少多少候选筛选成本。
来源:DeepTech 深科技
vLLM 针对真实 Agent 流量改造 KV 缓存,两周把 Kimi 高并发吞吐提高逾 6 倍
vLLM 团队针对 Agent 每轮重复读取长历史的问题,改造离卡 KV 缓存的保存与复用:共享前缀只保存一次,每轮只追加新增状态;跨机器拆分预填充与解码时,还可移交混合模型的完整状态。
- 发生了什么:相关优化来自真实 Agent 流量回放,两周内将 Kimi 的高并发推理吞吐提升超过 6 倍,并减少多个 Agent 分别保存相同前缀及每轮全量重写的浪费。
- 为什么值得深读:长程 Agent 的成本瓶颈开始从单次生成速度转向历史状态搬运、共享前缀复用和跨节点连续性;这类优化直接影响同一算力能承载多少持续会话。
- 后续看点:不同上下文长度和并发度下的吞吐曲线、缓存命中率、首 token 延迟,以及状态迁移对显存、主存和网络带宽的实际占用。
K2 Horizon 发布 0.9B 至 375B 六档模型,并开放训练代码、数据配方、检查点和日志
Institute of Foundation Models 发布 K2 Horizon 模型族,覆盖 0.9B、3.7B、7B 到 375B 等六个规模,同时交付权重之外的训练代码、数据配方、检查点、日志与评测记录。
- 发生了什么:发布方称六档模型在各自规模的编码和 Agent 任务中达到领先水平,其中 0.9B、3.7B 和 7B 刷新对应规模结果。
- 为什么值得深读:完整训练记录让研究者能够检查性能来自数据、训练策略还是评测设置,也使小模型路线具备复现实验和二次训练的基础,而不只是一组不可追溯权重。
- 后续看点:第三方复现能否在相同数据与算力预算下重现成绩,375B 模型的训练成本、许可证边界,以及不同规模的能力缩放是否连续。
🔥 今日聚合动态
世界模型从短视频生成转向可交互、长时持续和真实机器人迁移
四项更新分别补齐世界模型的控制、持续时间、开放数据和机器人迁移:Runway 让 Worlds 2 按输入持续生成影音世界;SolarWM 用短片训练后实现分钟至小时级 rollout;ZimaBlue 扩大视频预训练后提高真实机器人零样本成功率;World Labs Atlas 则从多模态输入重建可控 3D 视图。它们使用的任务和指标不同,不能直接横比,但共同把重点从“生成一段视频”移向“维持可行动的状态”。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 实时交互 | Runway | Worlds 2 连续生成 720p、24 fps 视频和 48 kHz 音频,文本动作与相机运动可持续注入,无预设时长 |
| 开放长时训练 | HuggingPapers | SolarWM 汇集 14 个数据集的 143 万片段和 4 种骨干,训练片段仅 5 秒,rollout 可持续分钟至小时 |
| 机器人迁移 | HuggingPapers | ZimaBlue 将视频预训练扩至 12 万小时,真实机器人零样本成功率由 36.1% 升至 77.8%,动作预测 30 Hz |
| 多视图重建 | InfoQ | Atlas 从多模态输入和相机移动生成图像、视频帧与 3D 视图 |
- 互补信息:生成质量之外,状态一致性、动作响应速度、长时漂移和跨实体执行正在成为同一条评测链上的不同环节。
- 后续看点:公开基准能否统一衡量交互延迟、长时一致性、物理错误率和真实机器人迁移,而不是继续依赖各项目自报演示。
📰 独立报道
AGI、Agent 与评测
Google 开源 Teamwork,用“生成—压力测试—组合”循环组织多智能体研究
Teamwork 将协作模式与 Agent 本身分离,按任务动态调整团队规模,并为不可拆任务、并行工程、开放数学、逐步验证和论文审查提供不同模式。长证明流程会给候选路线配置反驳者,保留失败路线中的可用部分,再综合进入下一轮。
来源:Datawhale
HarnessDev 评测模型能否自己开发 Agent 支架,自动产物仍落后于人工实现
字节跳动 Seed 提出 HarnessDev,把评测对象从任务最终输出转为可运行的 Agent 基础设施。研究覆盖 6 个“创建者”模型和 5 个基准;自动生成的支架在代码与搜索任务上仍落后于人工工程支架,后续自我演化带来的改进也不稳定。
Martian 用每个数据点重复运行 10 次衡量模型可靠性,揭示平均分掩盖的波动
AI Frontier 在 16 个常用基准上对每个数据点运行 10 次,把“同一提示下是否稳定答对或答错”与原始准确率分开。当前可靠性表中 Qwen3.7 Max 为 96.1%、Claude Opus 4.6 为 94.4%、GPT-5.5 为 93.5%;论文称同成本 oracle 路由可减少 54% 错误,但这是上界而非可直接部署的路由器。
苹果 IVT 把未来帧预测留在训练阶段,主动视频推理延迟降低逾 5 倍
IVT 在后训练时同时预测文本答案与未来视频帧的隐空间表示,推理时移除未来预测分支。Visual CoT 在两类任务中延迟约 6.55 秒,而 Answer-Only SFT 为 1.07—1.32 秒;IVT 在 6 项任务均超过 Answer-Only SFT,避免显式生成未来画面的误差和开销。
来源:AI 提效手册
Gemini 3.8 Flash Cyber 在 CWE-Bench 达到 47.2% pass@1
Google 发布 Gemini 3.8 Flash 与受限开放的 Flash Cyber。后者面向漏洞发现和自动修补,在外部 CWE-Bench 的 pass@1 为 47.2%;Google 另称其在覆盖 20 种语言的内部测试中成功率超过 70%,因网络安全限制更宽松,目前仅向受信任机构开放。
来源:Tech in Asia
Richard Sutton 把持续学习指向部署后的数据闭环与新架构
图灵奖得主 Richard Sutton 在 HICOOL 圆桌中强调,当前模型训练完成后权重基本固定,并非“一生中学习”。与会研究者把物理 AI 的技术缺口具体化为世界模型系统、部署数据回流、适配持续学习的新架构,以及尚未建立的持续学习基准。
来源:智源社区
OpenAI 确认自研人形与特种机器人,短期先服务数据中心
OpenAI CEO Sam Altman 首次明确公司将研发人形及其他形态机器人,短期重点不是家庭陪伴,而是协助熟练工人建设和运营数据中心。现有招聘已覆盖软件、电气、固件、控制、传感器、数据采集、故障处理和量产准备,显示其目标包括本体而非仅提供模型。
来源:虎嗅
AI 战略与工程
四家前沿模型服务同日出现重叠故障,长程 Agent 暴露供应商集中风险
OpenAI、Anthropic、xAI 与 Google 的云端模型服务在数小时内出现罕见重叠中断。Anthropic 报告多款 Claude 模型请求错误升高,OpenAI 则报告 ChatGPT 与 Codex 性能降级;对依赖持续调用的 Agent 工作流,跨模型降级和状态恢复需要从可选设计变成运行保障。
来源:Ars Technica
Humain 基于 MiniMax 开放模型开发阿拉伯语国家级 AI 平台
沙特 AI 公司 Humain 发布 humain-m3,底层采用 MiniMax 的开放模型,面向阿拉伯语场景建设国家级平台。该路线显示“主权 AI”不一定从基础模型零开始,也可能通过开放权重、本地数据与本地部署组合完成,但模型依赖来源同时进入国家级技术治理议题。
资管金融与区块链
Open Reserve 获美国全国性银行牌照有条件批准,核心系统按 24/7 链上结算设计
美国货币监理署对 Open Reserve 的全服务全国性银行牌照申请给予有条件批准。创始团队称将围绕全天候结算、稳定币、代币化存款和链上资本市场重建银行核心,并把核心账本类比为 L1;下一步关键是牌照条件落实及存贷款与链上结算的隔离设计。
来源:a16z crypto
Bottomline 用 Chainlink 把 ISO 20022 工作流接入公私链
Swift 服务商 Bottomline 与 Chainlink 合作,为 600 多家银行提供跨链、跨境支付入口。方案以 CCIP 连接公链与私链、CRE 编排端到端流程,银行可继续使用 ISO 20022 消息并通过单一网络无关连接访问链上通道;Bottomline 平台每年处理支付超过 16 万亿美元。
来源:Chainlink
Solana Payment Channels 把 Agent 高频 API 计费移到通道内,宣称每秒 100 万笔
Solana 上线 Payment Channels,针对 Agent 循环调用 API 时每次签名和结算的摩擦,将高频小额支付放进通道处理。首批场景包括阿里云 API 端点,官方宣称通道可达每秒 100 万笔支付;仍需独立披露测试拓扑、结算最终性与争议处理条件。
来源:Solana
SeoulLabs Pay 用 DID/VC 将代理身份、委托范围与付款凭证绑定
SeoulLabs 正开发 Agent 支付控制层:将通过 KYC 的委托人与兼容 W3C DID/VC 的代理凭证关联,把商户、资产、限额、有效期和人工审批触发器写入可撤销授权;确定性策略引擎在付款前校验,个人原始数据留在链下,审计证据可跨卡、转账、稳定币和链上结算保持一致。
硬件与算力
Cerebras CS-4 用三颗 WSE-3 Turbo 提供 250 PFLOPS 单晶圆算力
Cerebras 发布 CS-4 机架级系统,单机搭载三颗 WSE-3 Turbo;每片晶圆集成 4 万亿晶体管、90 万个 AI 核心,算力 250 PFLOPS、内存带宽 43.2 PB/s。公司宣称相对生产 GPU 系统推理最高快 30 倍、每瓦吞吐较 CS-3 提高 10 倍,并支持超千 token/s。
来源:Cerebras 视频
高通把 Matrix Cores 与 18MB 专用缓存加入 Adreno 图形管线
Adreno Neural Fusion 将神经处理、AI 超分和帧生成整合进移动 GPU 图形管线。专用 Matrix Cores 配合 18MB Adreno 高性能内存,减少模型在不同处理单元间搬运;高通称能效提高约 12%,并已获 Unity 与 Unreal Engine 支持。
来源:智东西
台积电设备需求八个月升至基准的 1.9 倍,全球约 20 座晶圆厂同步建设
台积电高管称设备需求从去年底基准升至今年 7 月的 1.9 倍,即便中国台湾地区有 13 座、全球其他地区另有五至六座晶圆厂在建,仍不足以满足需求。压力已从先进制程传向先进封装、ABF 基板、TGV 材料与日本上游设备供应商。
来源:华尔街见闻