前沿科技日报 · 2026-09-08
Agent 评测开始转向私有工作流与真实设备,Harness 的价值则被要求在等计算预算下重新证明
2026-09-08 前沿科技洞见 · 日报
过去一天,Agent 的讨论从“模型会不会做”进一步转向“在什么支架、验证和成本条件下做成”。Artificial Analysis 把 657 个业务工作流和更多私有任务纳入指数;真实机械臂实测显示,三个前沿模型即使都完成任务,对覆盖、反馈验证和交付物的取舍仍明显不同。与此同时,针对 Harness Evolution 的对照实验提醒团队:性能提升可能来自多试几次,而非运行框架真正进化。
📊 今日关键数据
- 657 个业务工作流:AutomationBench-AA 在 Gmail、Slack、Salesforce 等模拟应用中测试 Agent,私有任务或答案的指数权重升至 45%。(来源:Artificial Analysis)
- 1548 小时:Argus 在 27 个 Campaign 中累计运行,平均每 40.7 小时主动请求一次人工干预。(来源:AI提效手册)
- 71%:Gemini 3.7 Flash 与 3.1 Pro 通过 Teamwork 在 TCSBench 的成绩,上一代组合为 67.7%。(来源:北京智源人工智能研究院)
- 29.15%:华泰 AI 行业轮动模型截至 9 月 4 日的年内超额收益;同期 LLM-FADT 文本组合年内超额为 -6.5%。(来源:华泰证券金融工程)
- 30B 总参数、2B 激活参数:麒麟 9050 Pro 宣称可端侧运行的全模态 MoE 模型规模。(来源:智东西)
🔍 今日值得深读
Artificial Analysis 用 657 个业务工作流重做 Agent 指数
Intelligence Index v4.3 将 Terminal-Bench 由 2.1 升至 4.0,并以 AutomationBench-AA 替换 τ³-Banking。更新不只是换题:终端任务改用 mini-SWE-agent,私有任务或答案的评测权重由 40% 提高到 45%,目的是降低题目饱和与针对公开答案优化的空间。
- 发生了什么:Terminal-Bench 4.0 包含 66 个在 Agent 沙箱中执行的软件工程、机器学习、科学和运维多步任务;AutomationBench-AA 则在 Gmail、Slack、Salesforce 等模拟应用中测试 657 个业务工作流。指数类别权重保持 Agent 30%、编码 20%、通用能力 30%、科学推理 20%。
- 为什么值得深读:评测对象从单轮回答扩大到终端操作和跨应用工作流,且增加私有测试集,模型能力、Harness 质量与防刷榜机制被放进同一套评价框架。
- 后续看点:Coding Agent Index 纳入 Terminal-Bench 4.0 后,同一模型搭配不同 Harness 的排序是否变化,以及私有任务占比提高后头部模型分差是否收窄。
等预算对照显示 Harness 自进化可能只是“多试几次”
《Rethinking the Evaluation of Harness Evolution for Agents》在 Terminal-Bench 2.1 上控制推理预算,对传统 Harness Evolution、并行采样和连续修正进行比较。结果指向一个关键边界:若不给普通 Agent 同等次数的尝试,自进化方法的增益会混入额外测试时计算。
- 发生了什么:实验让各方法从仅含 bash 工具的极简 Harness 出发,每题统一为 K=5 次计算预算,测试 Claude Opus 4.6、GPT-5.4 和 GPT-5.4 mini。无单元测试时,并行采样优于传统 Harness Evolution;加入单元测试后,自进化仍未超过测试时扩展方法,对新任务的泛化提升也有限。
- 为什么值得深读:它把“框架变好”和“搜索次数变多”拆成可比较变量,为 Agent 自我改进研究补上了常被忽略的等算力基线。
- 后续看点:后续论文能否在未见任务、固定总 Token 与固定反馈次数下复现实质增益,并公开搜索过程、失败轨迹和 Harness 迁移结果。
来源:PaperWeekly
三款模型控制同一台机械臂,完成任务却采用三套成功标准
一项真实设备测试把同一句模糊指令交给 GPT-5.6 Sol、GPT-6 Astra Pro 和 Claude Fable 5.1,让它们驱动接入 Mac mini 的两轴云台完成水平与垂直满行程。三者都让设备动起来,但路径覆盖、反馈验证、复用交付和账单并不相同。
- 发生了什么:Sol 走到四个极限角以覆盖完整空间;Astra Pro 用较少动作验证边界,并为每一步读取反馈,但本次会话成本最高;Fable 5.1 执行更快且留下可复用脚本,成功判定却更宽松。测试未预先规定速度、路径和成功标准。
- 为什么值得深读:实体设备把“任务完成”拆成可观察的覆盖率、验证强度、风险和成本,避免只看模型是否输出了可执行命令。
- 后续看点:扩大设备与任务样本后,比较碰撞保护、传感器误差恢复、重复成功率、执行时延和单位成功任务成本;单次云台测试不足以外推通用机器人能力。
来源:AI科技评论
Gemini Teamwork 让 Flash 模型复现三项研究结果
Google Antigravity 团队披露多智能体编排框架 Teamwork:Gemini 3.1 Pro 在长证明模式中先取得七项数学与理论计算机科学结果,其中三项由更轻量的 Gemini 3.7 Flash 完整复现。3.7 Flash 与 3.1 Pro 的组合在 TCSBench 得到 71%,高于上一代组合的 67.7%。
- 发生了什么:框架并行生成候选策略,为每个策略配置反驳者,再将入选路线拆成有依赖关系的子问题;失败草稿、验证器发现的陷阱和已证结论进入共享知识库。Flash 复现的任务包括 ℓp 子空间近似 coreset、最大内积嵌入维度下界和将 Hadamard 量化领先常数降低约 5.93 倍。
- 为什么值得深读:新增信息不在“小模型突然更强”,而在竞争、反驳、依赖调度和跨轮记忆组成的系统怎样把旗舰模型结果交给低成本模型复核。
- 后续看点:公开证明能否经独立同行核验;在固定总计算量下,Teamwork 相对单 Agent 多次采样的增益、失败率和成本是否仍成立。
来源:北京智源人工智能研究院
微软 Argus 连续运行 1548 小时,把长程研究改为证据驱动
微软与上海交通大学等机构开源 Argus,一套面向数天研究任务的 Agent 推理运行时。技术报告覆盖 27 个 Campaign、累计 1548 小时墙钟时间,系统平均每 40.7 小时主动请求一次人工干预,报告工作占空比为 95.1%—98.7%。
- 发生了什么:Argus 将目标推进改为证据驱动,结合多 Agent 协作、自进化和核心—垂域解耦,覆盖 AI4AI、GPU Kernel、模型训练、AI4Science、芯片设计、数学与系统研究;代码、论文和部分成果仓库同时开放。
- 为什么值得深读:它没有只报告单次基准分数,而是把持续运行时间、人工介入频率和实际交付作为长程 Agent 的系统指标。
- 后续看点:独立团队能否复现 27 个 Campaign 的成果与占空比,以及在失败恢复、算力消耗、证据质量和人工复核时间上能否给出统一口径。
来源:AI提效手册
华泰 AI 行业轮动年内超额 29.15%,文本模型仍为负超额
华泰金工更新多套 AI 量化策略截至 9 月 4 日的表现。全频段量价模型对 32 个一级行业打分、每周等权持有 5 个行业,年内绝对收益 26.02%、相对等权基准超额 29.15%;另一套 LLM-FADT 文本组合 9 月超额反弹至 3.8%,但年内仍为 -6.5%。
- 发生了什么:行业轮动模型自 2017 年回测以来年化收益 27.52%、年化超额 21.21%。中证 1000 增强组合连续十周取得正超额,年内超额 3.07%,历史年化跟踪误差 6.56%、信息比率 3.12;组合均按周调仓并显式控制换手和交易成本。
- 为什么值得深读:同一更新同时给出强势的量价模型与仍落后的 LLM 文本模型,能避免把“用了 AI”直接等同于有效超额。
- 后续看点:实盘结果能否在换手、冲击成本和风格暴露约束下延续;LLM-FADT 的短期反弹能否扭转全年负超额。
来源:华泰证券金融工程
📰 独立报道
AGI、Agent 与评测
OpenBMB MiniCPM5-2B 刷新 4B 以下开放权重模型指数成绩
OpenBMB 的 MiniCPM5-2B 在 Artificial Analysis Intelligence Index v4.2 得分 15,成为总参数低于 4B 的开放权重模型最高分。这个结果提供了小模型能力密度的新比较点,但跨版本指数不可直接混排;后续需看它在 v4.3 私有工作流和新版 Terminal-Bench 上能否保持领先。
分子智能体从固定工具调用转向自主发现计算模块
一项分子大模型研究提出新的智能体框架,让系统不再只从预置工具箱调用模块,而是围绕科学任务发现、组合并验证计算能力。材料将方法重点落在工具发现与验证闭环,而非单次答案;真正的判断点是其相对固定工具基线的成功率、复现实验和失败边界。
来源:PaperWeekly
SRMA 用双层协同反思处理多智能体冲突
SRMA 把多智能体反思写成博弈论框架,通过 grounded risk descent 协调不同 Agent 的判断,在 SWE-bench 报告 72.2% 的问题解决率。该数字仍需结合所用模型、Harness、任务子集和推理预算理解;后续重点是同预算单 Agent 与普通投票基线能否复现差距。
DeepSeek Harness 以插件拆分模型、工具、沙箱和循环
DeepSeek Harness 以 MIT 协议开放开发者预览版,基于 Cordis 将模型适配器、会话存储、工具集、沙箱和 Agent Loop 都做成可热插拔组件,并加入双向 Agent 通信。当前版本为 0.1.2-alpha.1,官方提示未来可能破坏兼容,适合验证架构,不宜把早期成本说法直接外推到生产环境。
微软 Huabu 把 Agent 工作区从聊天流改成二维画布
微软亚洲研究院推出 Huabu,将网页、图片、文档、笔记和 Agent 结果放进可移动、分组和连线的二维空间。其 Collect—Organize—Act 三阶段可循环运行,Agent 产出会回到画布成为下一轮上下文;团队称后续将开源,届时可检验大规模项目中的协同延迟与上下文管理。
来源:AIGC开放社区
AI 战略与工程
Expedia 开源 mockql-rs,用 Schema 约束 LLM 生成模拟数据
Expedia 开源 Rust CLI 工具 mockql-rs,在请求时为带 @mock 标记的 GraphQL 字段生成数据,再与真实后端字段合并。它与 Airbnb 的构建时方案及 GraphQL 基金会第 0 阶段 RFC 设计不同;当前响应也不会标明真实与生成字段,测试便利与数据权威边界仍需同时处理。
来源:AI前线
ChatGPT Work 从连接内容中学习个人写作风格
OpenAI 表示 ChatGPT Work 可从连接的 Gmail、Google Drive、Slack 与 SharePoint 中学习常用措辞、落款和大小写习惯,并沿用到后续草稿。功能把连接器从事实检索扩大到持续风格建模;企业部署需进一步明确样本范围、撤回机制、跨项目隔离和代写披露。
Nirva 把 AI 原生可穿戴切入点放在长期个人上下文
Nirva 创始人吕唯在访谈中披露,首代设备不到 8 克、续航 2—3 天,只识别佩戴者声音;产品不主打会议纪要,而是积累情绪、关系与行为上下文,提供长期自我理解。团队不足 20 人,后续关键是语音识别边界、隐私存储和主动建议留存率。
来源:Founder Park
童欣加入 Meshy,目标从单体 3D 生成转向实时互动世界
前微软亚洲研究院图形学负责人童欣加入 Meshy,团队把下一阶段目标放在可实时互动的三维世界,而非只生成孤立模型。童欣长期研究纹理、几何与神经渲染;人员变化只有在技术路线落地后才有意义,后续需看世界一致性、资产可编辑性和实时渲染性能。
来源:极客公园
资管金融
夏普比率无法识别相同收益分布的路径差异
一项基金评价分析用相同的 60 个月收益率、不同排列顺序说明:均值、标准差乃至夏普比率完全相同,净值却可能形成持续上行或长回撤。正自相关还会使“月度夏普乘 √12”的年化方法失真;管理人评价应补充回撤、偏度、序列相关和 Trend R²。
来源:Quantis因子工作室
学术
LLaDA 用全扩散架构训练文生图模型
LLaDA 将图像生成改为全扩散架构,并强调无需传统图文对预训练。材料报告其在开放文生图比较中取得领先结果,技术价值在于重新安排语言条件与视觉生成的训练路径;仍需结合公开权重、数据构成、推理步数、分辨率和同算力基线判断优势能否复现。
来源:AI提效手册
硬件与算力
开放 TPU 推理基准开始按每 Token 成本对比 B200 与 B300
一个持续运行的开放基准首次系统展示 Google TPU 在多模型、多场景下的外部推理表现,发布者称其每 Token 成本优于 NVIDIA B200 和 B300。结论仍依赖模型、批量、精度、利用率与云端价格;开放结果的价值在于让 TPU 与 GPU 的比较进入可重复工作负载。
来源:@dylan522p
InferenceX 称 TPU 推理性价比最高提高 50%
SemiAnalysis 披露 InferenceX 推动 Google TPU 推理栈向外部客户开放,涉及 Ironwood、TPUv8i 和扩大的客户基础,并称部分场景性能价格比最高改善 50%。该数字需按工作负载核验;更具体的观察点是编译栈、模型覆盖和供给能否削弱 CUDA 迁移成本。
来源:SemiAnalysis
麒麟 9050 Pro 在手机端运行 30B-A2B 全模态模型
华为发布麒麟 9050 Pro:采用 9 核 CPU、自研马良 GPU、达芬奇 NPU 与巴龙基带,宣称可在端侧运行总参数 30B、激活参数 2B 的全模态 MoE 模型。搭载芯片的 Mate XT2 支持断网图库整理;后续需用功耗、首 Token 延迟和持续吞吐验证端侧模型体验。
来源:智东西