FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-09-08

Agent 评测开始转向私有工作流与真实设备,Harness 的价值则被要求在等计算预算下重新证明

降低FOMO的每日信息交付

2026-09-08 前沿科技洞见 · 日报

过去一天,Agent 的讨论从“模型会不会做”进一步转向“在什么支架、验证和成本条件下做成”。Artificial Analysis 把 657 个业务工作流和更多私有任务纳入指数;真实机械臂实测显示,三个前沿模型即使都完成任务,对覆盖、反馈验证和交付物的取舍仍明显不同。与此同时,针对 Harness Evolution 的对照实验提醒团队:性能提升可能来自多试几次,而非运行框架真正进化。

📊 今日关键数据

🔍 今日值得深读

Artificial Analysis 用 657 个业务工作流重做 Agent 指数

Intelligence Index v4.3 将 Terminal-Bench 由 2.1 升至 4.0,并以 AutomationBench-AA 替换 τ³-Banking。更新不只是换题:终端任务改用 mini-SWE-agent,私有任务或答案的评测权重由 40% 提高到 45%,目的是降低题目饱和与针对公开答案优化的空间。

来源:Artificial Analysis

等预算对照显示 Harness 自进化可能只是“多试几次”

《Rethinking the Evaluation of Harness Evolution for Agents》在 Terminal-Bench 2.1 上控制推理预算,对传统 Harness Evolution、并行采样和连续修正进行比较。结果指向一个关键边界:若不给普通 Agent 同等次数的尝试,自进化方法的增益会混入额外测试时计算。

来源:PaperWeekly

三款模型控制同一台机械臂,完成任务却采用三套成功标准

一项真实设备测试把同一句模糊指令交给 GPT-5.6 Sol、GPT-6 Astra Pro 和 Claude Fable 5.1,让它们驱动接入 Mac mini 的两轴云台完成水平与垂直满行程。三者都让设备动起来,但路径覆盖、反馈验证、复用交付和账单并不相同。

来源:AI科技评论

Gemini Teamwork 让 Flash 模型复现三项研究结果

Google Antigravity 团队披露多智能体编排框架 Teamwork:Gemini 3.1 Pro 在长证明模式中先取得七项数学与理论计算机科学结果,其中三项由更轻量的 Gemini 3.7 Flash 完整复现。3.7 Flash 与 3.1 Pro 的组合在 TCSBench 得到 71%,高于上一代组合的 67.7%。

来源:北京智源人工智能研究院

微软 Argus 连续运行 1548 小时,把长程研究改为证据驱动

微软与上海交通大学等机构开源 Argus,一套面向数天研究任务的 Agent 推理运行时。技术报告覆盖 27 个 Campaign、累计 1548 小时墙钟时间,系统平均每 40.7 小时主动请求一次人工干预,报告工作占空比为 95.1%—98.7%。

来源:AI提效手册

华泰 AI 行业轮动年内超额 29.15%,文本模型仍为负超额

华泰金工更新多套 AI 量化策略截至 9 月 4 日的表现。全频段量价模型对 32 个一级行业打分、每周等权持有 5 个行业,年内绝对收益 26.02%、相对等权基准超额 29.15%;另一套 LLM-FADT 文本组合 9 月超额反弹至 3.8%,但年内仍为 -6.5%。

来源:华泰证券金融工程

📰 独立报道

AGI、Agent 与评测

OpenBMB MiniCPM5-2B 刷新 4B 以下开放权重模型指数成绩

OpenBMB 的 MiniCPM5-2B 在 Artificial Analysis Intelligence Index v4.2 得分 15,成为总参数低于 4B 的开放权重模型最高分。这个结果提供了小模型能力密度的新比较点,但跨版本指数不可直接混排;后续需看它在 v4.3 私有工作流和新版 Terminal-Bench 上能否保持领先。

来源:Artificial Analysis

分子智能体从固定工具调用转向自主发现计算模块

一项分子大模型研究提出新的智能体框架,让系统不再只从预置工具箱调用模块,而是围绕科学任务发现、组合并验证计算能力。材料将方法重点落在工具发现与验证闭环,而非单次答案;真正的判断点是其相对固定工具基线的成功率、复现实验和失败边界。

来源:PaperWeekly

SRMA 用双层协同反思处理多智能体冲突

SRMA 把多智能体反思写成博弈论框架,通过 grounded risk descent 协调不同 Agent 的判断,在 SWE-bench 报告 72.2% 的问题解决率。该数字仍需结合所用模型、Harness、任务子集和推理预算理解;后续重点是同预算单 Agent 与普通投票基线能否复现差距。

来源:Hugging Papers

DeepSeek Harness 以插件拆分模型、工具、沙箱和循环

DeepSeek Harness 以 MIT 协议开放开发者预览版,基于 Cordis 将模型适配器、会话存储、工具集、沙箱和 Agent Loop 都做成可热插拔组件,并加入双向 Agent 通信。当前版本为 0.1.2-alpha.1,官方提示未来可能破坏兼容,适合验证架构,不宜把早期成本说法直接外推到生产环境。

来源:Lingowhale 专题

微软 Huabu 把 Agent 工作区从聊天流改成二维画布

微软亚洲研究院推出 Huabu,将网页、图片、文档、笔记和 Agent 结果放进可移动、分组和连线的二维空间。其 Collect—Organize—Act 三阶段可循环运行,Agent 产出会回到画布成为下一轮上下文;团队称后续将开源,届时可检验大规模项目中的协同延迟与上下文管理。

来源:AIGC开放社区

AI 战略与工程

Expedia 开源 mockql-rs,用 Schema 约束 LLM 生成模拟数据

Expedia 开源 Rust CLI 工具 mockql-rs,在请求时为带 @mock 标记的 GraphQL 字段生成数据,再与真实后端字段合并。它与 Airbnb 的构建时方案及 GraphQL 基金会第 0 阶段 RFC 设计不同;当前响应也不会标明真实与生成字段,测试便利与数据权威边界仍需同时处理。

来源:AI前线

ChatGPT Work 从连接内容中学习个人写作风格

OpenAI 表示 ChatGPT Work 可从连接的 Gmail、Google Drive、Slack 与 SharePoint 中学习常用措辞、落款和大小写习惯,并沿用到后续草稿。功能把连接器从事实检索扩大到持续风格建模;企业部署需进一步明确样本范围、撤回机制、跨项目隔离和代写披露。

来源:ChatGPT,经 @kimmonismus 转引

Nirva 把 AI 原生可穿戴切入点放在长期个人上下文

Nirva 创始人吕唯在访谈中披露,首代设备不到 8 克、续航 2—3 天,只识别佩戴者声音;产品不主打会议纪要,而是积累情绪、关系与行为上下文,提供长期自我理解。团队不足 20 人,后续关键是语音识别边界、隐私存储和主动建议留存率。

来源:Founder Park

童欣加入 Meshy,目标从单体 3D 生成转向实时互动世界

前微软亚洲研究院图形学负责人童欣加入 Meshy,团队把下一阶段目标放在可实时互动的三维世界,而非只生成孤立模型。童欣长期研究纹理、几何与神经渲染;人员变化只有在技术路线落地后才有意义,后续需看世界一致性、资产可编辑性和实时渲染性能。

来源:极客公园

资管金融

夏普比率无法识别相同收益分布的路径差异

一项基金评价分析用相同的 60 个月收益率、不同排列顺序说明:均值、标准差乃至夏普比率完全相同,净值却可能形成持续上行或长回撤。正自相关还会使“月度夏普乘 √12”的年化方法失真;管理人评价应补充回撤、偏度、序列相关和 Trend R²。

来源:Quantis因子工作室

学术

LLaDA 用全扩散架构训练文生图模型

LLaDA 将图像生成改为全扩散架构,并强调无需传统图文对预训练。材料报告其在开放文生图比较中取得领先结果,技术价值在于重新安排语言条件与视觉生成的训练路径;仍需结合公开权重、数据构成、推理步数、分辨率和同算力基线判断优势能否复现。

来源:AI提效手册

硬件与算力

开放 TPU 推理基准开始按每 Token 成本对比 B200 与 B300

一个持续运行的开放基准首次系统展示 Google TPU 在多模型、多场景下的外部推理表现,发布者称其每 Token 成本优于 NVIDIA B200 和 B300。结论仍依赖模型、批量、精度、利用率与云端价格;开放结果的价值在于让 TPU 与 GPU 的比较进入可重复工作负载。

来源:@dylan522p

InferenceX 称 TPU 推理性价比最高提高 50%

SemiAnalysis 披露 InferenceX 推动 Google TPU 推理栈向外部客户开放,涉及 Ironwood、TPUv8i 和扩大的客户基础,并称部分场景性能价格比最高改善 50%。该数字需按工作负载核验;更具体的观察点是编译栈、模型覆盖和供给能否削弱 CUDA 迁移成本。

来源:SemiAnalysis

麒麟 9050 Pro 在手机端运行 30B-A2B 全模态模型

华为发布麒麟 9050 Pro:采用 9 核 CPU、自研马良 GPU、达芬奇 NPU 与巴龙基带,宣称可在端侧运行总参数 30B、激活参数 2B 的全模态 MoE 模型。搭载芯片的 Mate XT2 支持断网图库整理;后续需用功耗、首 Token 延迟和持续吞吐验证端侧模型体验。

来源:智东西