前沿科技日报 · 2026-08-29
长程智能体从“给出答案”转向可验证地完成工作,推理成本、持续学习和安全校准同时进入工程闭环
2026-08-29 前沿科技洞见 · 日报
过去 24 小时的新材料集中在三个变化:评测开始检查智能体真正改了什么、提交了什么,而不只核对回答;长推理通过裁剪中间 KV Cache 降低持续计算成本;模型又被用于校准其他模型、维护 Agent Harness 和构建可由 Lean 核验的数学工程。共同的约束也更清楚:可测目标能被快速优化,稀有错误、跨任务遗忘和长程执行失败仍需要独立验证。
📊 今日关键数据
- 61.7%:CommerceAgentBench 最佳观测运行完成 107 项真实电商任务中的 66 项(来源:Chubby / X)
- 5224 tok/s:Prefix Sliding 在 128K 长序列下的吞吐;全注意力为 448 tok/s(来源:PaperWeekly)
- 99.4 万行:FormaTheoria 已生成的相互关联 Lean 代码规模,覆盖 4 个关键定理(来源:量子位)
- 80 分:Perplexity Search 中档上下文在 Artificial Analysis Search Index 的得分,原领先者为 75 分(来源:Artificial Analysis)
- 2310 万笔:过去 30 天 AI Agent 经 x402 完成的稳定币转账数(来源:Token Terminal)
- 500 万亿 Token/日:材料给出的中国 2026 年二季度末日均调用量,因厂商口径不同不可直接横比(来源:虎嗅)
🔍 今日值得深读
Prefix Sliding 移除中间推理缓存,128K 序列吞吐从 448 提至 5224 tok/s
斯坦福、华盛顿大学等团队提出 Prefix Sliding:固定保留任务前缀,只让最近 W 个推理 token 留在滑动窗口,更早的中间 token 退出后续注意力。方法无需重训,并配套面向 NVIDIA Hopper 的 FlashAttention 内核。
- 发生了什么:以 Qwen3-1.7B 为主模型,在 AIME25、GPQA、MATH500 上,4096-token 窗口与全注意力表现接近;128K 长度下吞吐达到 5224 tok/s,全注意力为 448 tok/s。按相近任务表现比较,思考时间最高缩短约 3 倍;用于强化学习时,单条轨迹可超过 10 万 token。
- 为什么值得深读:它把测试时扩展的瓶颈从“完整历史必须常驻”改成“任务前缀加近期工作区”,且明确区分了吞吐提升与单 token 质量提升。
- 后续看点:不同模型、窗口尺寸和非数学任务上的质量退化,以及 Hopper 专用内核之外的硬件收益。
来源:PaperWeekly
Claude 在 48 小时和 1 块 GPU 内自动改进 10 类对齐缺陷
Anthropic 让 Claude 自主研究、提出方法、训练并测试小模型,目标是在不损害通用能力的条件下修复欺骗、谄媚等可测失配行为。
- 发生了什么:系统在 10 类对齐失败上均提高安全分数,最佳方法迁移到未参与优化的基准、Petri 行为审计和最大 4.7 倍规模的模型;Sonnet 5 后训练早期 Opus 4.8 检查点后,其安全分数接近完整对齐训练的生产版 Opus 4.8。
- 为什么值得深读:实验把自动化研究从提出方案推进到训练、评测和跨模型迁移,且设置了“不得降低一般能力”的约束。
- 后续看点:没有现成基准的稀有或隐蔽失配能否被发现,以及对更强后继模型的迁移是否仍成立。
来源:Anthropic
CommerceAgentBench 用 107 项电商任务核验智能体实际交付,最佳通过率 61.7%
Accio 开源 CommerceAgentBench,覆盖采购、商品发布、运营、履约和售后;智能体需要跨浏览器、邮件、日历、文档、API 与文件操作,评分器检查实际保存、修改或提交的结果。
- 发生了什么:107 项任务来自 1000 万中小企业用户、160 万次对话、20 万条 Agent 轨迹及阿里巴巴电商经验。一个采购案例要求从约 300 封邮件重建报价,处理 6 种贸易术语、4 种货币和到岸成本,同时识别付款欺诈并完成邮件标记、草稿与日程动作。
- 为什么值得深读:基准把“说自己完成了”与“系统状态真的改变了”分开;最佳观测运行只完成 66 项,暴露了真实工作流中的长程执行缺口。
- 后续看点:任务环境是否可稳定复现、评分器能否覆盖副作用与权限风险,以及不同 Agent 在同一工具预算下的表现。
来源:Chubby / X
FormaTheoria 产出 99.4 万行 Lean 理论,开始核验有限单群分类的文献链
清华求真书院、丘成桐数学科学中心、智能产业研究院与华威大学团队构建 FormaTheoria:从原始文献追踪依赖、整合定义、生成形式化证明,再交给 Lean 逐步核验。
- 发生了什么:项目 7 个月完成 4 个关键定理的形式化,形成超过 99.4 万行相互关联的代码化数学理论;依赖感知并行策略带来 4.2 倍加速。最初 3 个主要来源在推进中扩展出 12 个来源,补充材料占查阅页码的 65.6%。
- 为什么值得深读:对象不是准备完备的单题,而是跨数百篇文献、符号和默认条件不一致的证明工程;机器核验能够暴露定义、条件和排版错误。
- 后续看点:距离完整核验近两万页有限单群分类证明还有多远,新增 Lean 代码的人类复核成本和依赖库稳定性如何。
来源:量子位
Harness Continual Learning 让冻结模型通过提示、记忆、技能和工具持续演化
南京大学与伍伦贡大学研究者把持续学习对象从模型参数扩展到 Agent Harness,在基础模型冻结时更新任务接口、经验记忆、能力地图和执行组织等状态。
- 发生了什么:框架以 Proposal–Evaluation–Commitment 闭环处理连续任务:提出 Harness 更新,评估新任务收益与旧能力损失,再决定是否提交;实验覆盖多类任务流,并同时观察性能和遗忘。
- 为什么值得深读:生产中的智能体常靠提示词、记忆、工具与路由变化获得新能力,这项工作把这些外部状态纳入持续学习的统一研究对象。
- 后续看点:长期任务序列中评估集污染、错误记忆累积和跨组件更新冲突,能否被稳定检测与回滚。
来源:AI提效手册
Perplexity Search 在统一 Agent Harness 中得分 80,领先原榜首 5 分
Artificial Analysis 用同一 GPT-5.6 Luna、同一开源 Stirrup Harness 和同一网页工具,仅替换搜索服务商,比较 Perplexity Search 的低、中、高三档上下文。
- 发生了什么:中档上下文得分 80,高、低档分别为 79 和 77;原领先者 Parallel advanced 与 Brave LLM context 均为 75。优势主要来自 BrowseComp,AA-Omniscience 与 DeepSearchQA 和其他领先服务接近。
- 为什么值得深读:评测同时给出质量、查询次数和成本。Perplexity 三档模型推理成本为每任务 0.028–0.034 美元;中、高档总成本约 0.091 美元,延迟处于中游。
- 后续看点:中档到高档质量已趋于平台期;需继续观察榜单在不同模型、实时网页变化和失败查询上的稳定性。
📰 独立报道
AGI 与智能体
腾讯开源混元 Hy4 preview:770B 参数、1M 上下文进入办公与编程产品
混元 Hy4 preview 将总参数从 295B 提至 770B、激活参数从 21B 提至 49B,上下文从 256K 扩至 1M。腾讯组织 163 名专家盲测 203 个工程任务,平均得分 2.99/4;模型还参与训练方法、数据策略、评估和算子优化,使推理吞吐较基线提升 31.8%。
来源:极客公园
智谱开放 GLM-5.3 权重,定位 Agent 编程与网络防御
智谱宣布 GLM-5.3 开放权重,可下载、本地运行和定制;官方将其定位为当前最强的 Agent 编程与网络防御模型,并同步给出 Hugging Face 权重与技术博客入口。后续需要由独立评测补齐具体基准、推理硬件、成本和网络安全能力边界。
来源:智谱 AI
EBR-bench 人类基线显示:AI 首局更强,但连续游玩后几乎不进步
Epoch AI 让参与者在与 AI 相近的文本界面上完成最多 10 次 Earthborne Rangers 长程任务。约一半人类最终超过 AI,几乎所有人都会随经验改善,最佳参与者 5 局后掌握游戏;已测 AI 初局常领先,却只出现轻微提升,显示跨回合学习仍是缺口。
来源:Epoch AI
RLHEV 把游戏引擎变成世界模型的可验证奖励源
RLHEV 提出用游戏开发过程生成世界模型后训练数据,以引擎产生的密集、可验证信号和人类验收反馈替代模糊的 CLIP 分数。材料同时提供论文与复现包入口;实际扩展价值仍取决于不同引擎、任务类型和人类验收成本下的复现结果。
Claude 用 5 周协助推导任意近球形粒子的电泳迁移率,团队公开约 160 轮纠错记录
科罗拉多大学团队用 Claude Sonnet 4.6、Opus 4.6 和 Claude Code 辅助处理形状扰动、电场、离子云与流体响应的耦合推导,论文发表于《流体力学杂志》。首阶段计算未收敛,模型多次出错或编造;研究者公开关键对话,明确结果来自人类选定方法、持续质询与核验。
来源:DeepTech 深科技
工程、安全与产品
SeekMoon 用 MoonBit 工具替代 Shell,把智能体权限边界放进语言运行时
SeekMoon 提出“语言即沙箱”:智能体不直接拼写并执行 Shell,而通过 MoonBit 工具获得更细粒度、跨平台的能力边界。材料称 MoonBit 编译可达百毫秒级、分发体积较小;这一方案的关键检验是文件系统、网络和进程权限能否默认最小化并留下完整审计。
来源:CSDN 公众号
Cloudflare 发布 Kitesurf,向智能体提供专用浏览器引擎
Cloudflare 发布面向 AI 智能体的 Kitesurf 浏览器引擎,把网页访问作为 Agent 基础设施单独封装。正式材料未提供可比较的性能或安全指标;后续应关注其页面兼容性、反自动化处理、会话隔离,以及与通用浏览器自动化方案的资源开销差异。
来源:InfoQ 中文站
Meta 在数据中心测试机器人换线缆、重启服务器
Meta 正测试让机器人执行更换线缆、重置服务器等现场技术员任务。场景把具身智能带进高度标准化但容错要求严格的数据中心;决定能否规模部署的指标包括操作成功率、设备停机时间、远程接管频率和与现有运维流程的安全隔离。
来源:WIRED
Meta 限制遮挡提示灯后的眼镜录制,非自愿拍摄风险仍未消失
Meta 针对 AI 眼镜被用于非自愿录制的问题关闭一处规避路径,限制用户遮挡用于提醒旁人的 LED 后继续拍摄。这是设备侧隐私控制的具体修补,但仍需观察遮挡检测误判、旁观者知情机制,以及录音、云端处理和数据保留政策。
来源:Ars Technica
OCaml 项目漏洞传闻出现后数分钟即有利用尝试
剑桥大学教授、OCaml 核心维护者 Anil Madhavapeddy 报告,部分 OCaml 项目的安全问题刚出现线索,数分钟内就观察到利用尝试。事件说明漏洞发现与武器化窗口正在缩短;维护者需要更快完成私下披露、补丁分发、日志检测和依赖方通知。
资管金融与区块链
x402 过去 30 天承载 2310 万笔 Agent 稳定币转账,几乎全部使用 USDC
Token Terminal 统计显示,AI Agent 过去 30 天通过 x402 完成 2310 万笔稳定币转账,其中 Base 930 万笔、Solana 790 万笔、Polygon 540 万笔,几乎全部使用 USDC。数据说明机器支付已形成可观调用量,但未披露金额、独立 Agent 数、失败率和真实业务构成。
中国日均 Token 调用量二季度末升至 500 万亿,统计口径尚未统一
材料称中国日均 Token 调用量从 2025 年底的 100 万亿升至 2026 年一季度末 140 万亿、二季度末 500 万亿。不同厂商的分词、缓存、输入输出和跨境调用口径并不一致,因此该数字适合观察增长方向,暂不能直接换算为统一的 AI 产出或经济规模。
来源:虎嗅
硬件与算力
美国拟堵住经第三国数据中心远程使用受限 AI 芯片的出口管制路径
美国政府据报正在起草规则,针对中国公司通过泰国等第三国数据中心远程取得 AI 芯片算力的路径。若规则落地,管制对象将从芯片实物流向延伸到云端算力访问;具体影响取决于客户识别、算力转售、数据中心所在地和执行责任的定义。
全球数据中心年耗电约 415 TWh,电网开始讨论大型负荷专属成本
LSE 研究文章估算全球数据中心每年耗电约 415 TWh,占总需求 1.5%,到 2030 年可能升至 945 TWh;美国 PJM 批发电价过去一年从每 MWh 77.78 美元升至 136.53 美元。英国 Ofgem 拟向数据中心收取项目成本 2.5%–7.5% 的接网承诺费,讨论重点转向新增电网成本由谁承担。