前沿科技日报 · 2026-09-11
Agent 从“会回答”进入“可托管、可接数据、可审计”的生产阶段
2026-09-11 前沿科技洞见 · 日报
📊 今日关键数据
- 4 倍:Agents API 早期用户报告多子 Agent 编排延迟最高降低 4 倍(来源:OpenAI)
- 近 80%:Speak 评估中,GPT-Live-1 相比旧式轮流对话系统减少近八成误打断(来源:OpenAI)
- 81.7 分:JoyAI-EchoWM 在 158 个 WBench Navigation 案例上的平均分(来源:AI提效手册)
- 54.8%:30B OpenResearcher 在 BrowseComp-Plus 的报告得分,较基座提高 34 个百分点(来源:Lambda)
- 4,084 道:WearableQA 基于 200 名用户真实可穿戴数据构造的十选一问题数量(来源:HuggingPapers)
- 38GW 以上:微软据称规划的 2032 年数据中心容量,当前约为 12GW(来源:Techmeme / Bloomberg)
🔍 今日值得深读
OpenAI 公测 Agents API,把 Codex 的长程运行框架开放给开发者
OpenAI 将支撑 Codex 的托管 Agent 框架封装为公开测试版 API:系统负责上下文管理、工具调用和子 Agent 编排,任务可持续运行数天;开发者可选 OpenAI 沙箱、自有基础设施或合作方沙箱。早期用户 Ciridae 报告评测分数由 0.71 升至 0.85,多子 Agent 流程延迟降低 4 倍。
- 发生了什么:一次调用即可指定任务、模型、工具与运行环境,并获得自动上下文压缩、MCP 工具兼容和长任务中间结果保存能力。
- 为什么值得深读:竞争焦点从单次模型调用转向 Harness、状态管理、运行可靠性和环境隔离,开发团队可以少维护一层 Agent 基础设施。
- 后续看点:公开测试期的长任务成功率、沙箱间迁移成本、权限控制,以及“无需额外服务费”在正式商用后的计价方式。
来源:OpenAI
GPT-Live-1 用单模型全双工音频减少语音 Agent 的脆弱交接
OpenAI 在 API 上推出 GPT-Live-1,让同一模型同时处理输入与输出音频,避开 STT—LLM—TTS 串联架构的延迟和交接故障;它还可把深度推理与工具调用委托给后端文本模型。Speak 的早期评估显示,相比旧式轮流对话系统,模型误打断学习者的次数减少近 80%。
- 发生了什么:API 支持语气、语速与风格控制、静默和背景噪声处理、长会话、电话场景;正式输入给出的全双工基准相对 GPT-Realtime-2.1 提升 30 分,前端语音层价格为每分钟 0.05 美元。
- 为什么值得深读:语音 Agent 的工程瓶颈正从识别准确率转到并发听说、打断时机、长会话状态和后端工具协作。
- 后续看点:真实呼叫中心中的端到端延迟、噪声条件下误打断率、后端推理调用成本,以及电话网络中的稳定性。
来源:OpenAI
AutoScientist-Quant 把搜索反馈与最终测试隔离,修复量化 Agent 的回测泄漏
Google 与剑桥研究者检查 AlphaAgent、QuantaAlpha 后发现:指标计算曾使用全样本,时间筛选逻辑也会让模型在训练时段接受评价。AutoScientist-Quant 因此把数据分成训练、验证、搜索反馈和最终测试四段,让 Agent 只能在 2021 年 6 月至 2023 年 6 月的反馈窗迭代,2023 年 6 月至 2026 年 5 月留作独立检验。
- 发生了什么:基线方案在沪深 300 上 IC 均为 0.024,但扣费年化超额分别为 -2.3% 和 -1.6%;修正流程并合并 Alpha158 因子库后,部分配置的沪深 300 扣费超额达到 3.5%。
- 为什么值得深读:它揭示了 Agent 回测的第二层泄漏——即使预测模型没见测试数据,Agent 只要依据测试期指标改因子,测试集也已参与训练式决策。
- 后续看点:独立时段成绩能否跨市场、跨交易成本设定复现,以及最终测试结果公开后是否启用新的封存区间;现有结果仍是历史回测,不是实盘记录。
来源:QuantML
京东开源 EchoWM,把可交互世界扩展到同步视听与跨视角控制
京东探索研究院开源 JoyAI-EchoWM:模型在一套框架内持续生成画面、环境音、音乐和语音,并响应第一、第三人称的相机与主体操作。论文报告在 158 个 WBench Navigation 案例上取得 81.7 平均分,一致性 89.8、交互性 87.2;四步因果流式版本 EchoWM-Flash 得分 81.0。
- 发生了什么:系统用统一相机意图表示适配不同视角,并以四阶段训练兼顾视听质量、交互响应与长时稳定性。
- 为什么值得深读:可交互生成暴露了普通视频容易遮蔽的错误——折返后物体位置、主体状态和声音都必须延续,评价对象从单帧观感变成状态一致性。
- 后续看点:开源版本在社区硬件上的实时帧率、长时间折返的一致性、复杂声音事件同步,以及 WBench 之外的复现结果。
来源:AI提效手册
DrugEvolve 让 Agent 自主改写、训练和复盘药物算法
浙江大学、上海交通大学和上海创智学院团队提出 DrugEvolve。研究者提供任务、数据、基线算法和目标后,Researcher、Engineer、Analyst 三类角色依次设计方案、实现和训练代码、分析成败,再把文献知识与每轮实验记录写入长期资源,形成持续迭代闭环。
- 发生了什么:系统优化的是药物研发算法本身,而非只对一个固定模型提问;数据库同时保留成功和失败轨迹。
- 为什么值得深读:它把科研 Agent 的评价推进到“能否稳定改善可执行基线”,同时覆盖多种数据形态与药物研发阶段。
- 后续看点:各任务相对人工与自动搜索基线的完整指标、总计算成本、失败迭代比例,以及新数据集上的可复现性。
来源:BAAI 智源
Alpha-R1 用语义门控筛选与市场状态匹配的配置思路
财跃星辰与上海交大开源 8B 金融推理模型 Alpha-R1。模型先结合决策时点前的行情和财经新闻生成市场状态,再用“语义门控”匹配候选配置逻辑;两阶段训练先由数值方法生成候选池,再以 GRPO 和模拟收益信号训练模型复筛。
- 发生了什么:团队以训练未见的 2025 年 12 个月行情做样本外模拟;消融实验中,去掉强化学习后,标普 500 任务模拟年化收益由 47.87% 降至 12.85%。
- 为什么值得深读:方法把资产配置从静态因子组合改成“市场状态—经济逻辑”条件匹配,并提供可读解释;模型、代码与技术报告均已开放。
- 后续看点:交易成本和换手约束下的净收益、不同市场状态的门控稳定性,以及跨年份、跨资产复现;全部数字均为历史模拟,不构成投资建议。
来源:财联社 AI Daily
📰 独立报道
AGI、Agent 与评测
OpenResearcher 以离线研究轨迹训练 30B 开放模型,BrowseComp-Plus 得分 54.8%
Lambda 披露,OpenResearcher 完全使用离线研究轨迹训练,BrowseComp-Plus 得分比基座高 34 分,并超过其列出的 GPT-4.1、Claude-4-Opus 与 DeepSeek-R1;模型还迁移到实时网络任务。正式材料未给出硬件、成本和失败类别,结论仍需论文与独立复现补齐。
来源:Lambda
AgentGrad 用顺序干预优化多 Agent 提示词,报告 2.5 倍加速
AgentGrad 逐一干预多 Agent 系统组件,再把结果抽象成语义文本梯度,用于定位和改写提示词。作者报告该方法在 5 个多 Agent 基准达到新的最佳成绩,优化速度提高 2.5 倍;正式材料未披露各基准分数、模型和预算条件,跨模型泛化仍待核验。
Polaris-Bench 用极坐标重写 53 项任务,检查视觉推理是否依赖笛卡尔捷径
Google DeepMind 在 Hugging Face 发布 Polaris-Bench,将 53 项视觉推理任务改写到极坐标表示,以削弱模型从常见横纵坐标布局中套用模式的机会。当前正式材料只给出任务设计,尚无模型排行和误差拆解;它更适合作为检验坐标表征鲁棒性的新增测试集。
WearableQA 用 200 名用户真实可穿戴数据构造 4,084 道十选一问题
Meta 发布 WearableQA,以 200 名用户的日常健康信号构造 4,084 道十选一问题,测试模型跨时间解释活动与生理数据的能力。正式输入没有列出模型基线、准确率和隐私处理方法,因此当前价值主要在真实数据分布与多选难度设计,不能据此判断模型能力高低。
Show-Harness 用语义接口让 VLM 零样本控制两类真实机械臂
新加坡国立大学 Show Lab 提出紧凑语义接口,使前沿 VLM 可零样本控制 Franka 与 AgileX 真机,小型开放模型则用不足 1 个 H200 GPU 小时微调获得控制能力。材料未给出任务成功率和安全失败类型,后续需比较接口抽象带来的迁移收益与动作精度损失。
宇树开源 UnifoLM-WLA-1.0,用同一模型协调桌面与全身移动操作
宇树开源升级版具身基础模型 UnifoLM-WLA-1.0,覆盖桌面操作与全身移动操作,并支持跨任务、跨末端执行器泛化。官方称其在多个开放模型基准达到新最佳成绩,但正式材料没有逐项分数与硬件条件;实际价值要看权重、数据和真机评测能否完整复现。
来源:Unitree
可编程世界模型把状态演化、持久记忆和视频渲染拆成三层
Alaya Lab 的方案不让视频模型独自承担世界一致性:Agent 编写可执行规则,持久状态引擎跟踪画面外实体,视频模型只负责渲染。这种分层结构便于明确规则和调试隐藏状态,但正式材料尚未提供长程一致性指标与速度成本,仍需与端到端世界模型对照。
AI 战略与工程
Anthropic 披露针对 Claude 的大规模蒸馏活动
Anthropic 称,DeepSeek、Moonshot 等公司通过境外“中转站”、数千个虚假账户和数百万条真实用户查询,试图蒸馏 Claude 能力;TechCrunch 将其描述为近期持续升级的活动。相关数字与归因来自 Anthropic 单方报告,外部尚无独立技术复核。
Anthropic 把模型滥用监测扩展到网络攻击、监控和生物风险
Anthropic 发布威胁情报报告,列出其阻断的网络行动、监控、影响行动、常规武器、生物滥用、诈骗及非法蒸馏案例。公司另称曾中止可能帮助生物武器研发的研究,但无法判断其合法或恶意目的;边界问题在于安全团队需要依据有限上下文暂停高风险科研。
Google Cloud 把云端知识与工具封装成可安装的编码 Agent 插件
Google Cloud 发布面向 AI 编码 Agent 的插件包,让不同 Agent 安装针对 Google Cloud 的技能和工具。它把云文档、操作入口和工作流从临时提示词转成可分发组件;后续需观察支持的 Agent 范围、凭证隔离方式,以及插件升级时对既有自动化的兼容性。
Slackforce Surfaces 允许在对话中生成可交互报表和微型应用
Slack 新功能可让 Slackbot 从相关对话及 Google Drive、Salesforce 等连接应用收集信息,再在聊天中生成报表、投票、仪表盘、演示或微型网站。产品把企业协作中的“找数据—写代码—发布界面”压成一条对话工作流,权限继承和生成结果校验将决定能否安全落地。
来源:The Verge
加州限制未成年人使用成瘾式功能及与聊天机器人的交互
加州州长 Gavin Newsom 签署一组儿童网络保护法案,限制 16 岁以下用户接触被认定为“成瘾性”的社交功能,并约束未成年人和聊天机器人的互动。对产品团队而言,变化落在年龄识别、交互限制和未成年人体验分流;具体生效日期与实施细则仍需跟进。
资管金融与区块链
ChatGPT for Financial Services 内置金融数据与逐项来源追踪
OpenAI 推出面向金融机构的 ChatGPT Work 版本,由 Morgan Stanley 和 Evercore 参与设计,内置 Daloopa、PitchBook、LSEG News、Crunchbase 等数据,用于研究、建模和客户材料。数据由 OpenAI 索引托管,并提供细粒度引用与企业级连接、权限和治理控制,目前只向符合条件的机构开放。
来源:OpenAI
蚂蚁数科 Agentar 金融版用 2,000 多项指标管理岗位级 Agent
蚂蚁数科发布 Agentar 金融版,预置覆盖财富管理、投顾和零售经营的十大数字专家团,并统一管理模型、Agent、技能和任务流程。平台称内置 2,000 多项金融评测指标及双向安全校验;某试点报告客户活跃度提升 15%、单人服务量提高 5 倍以上,仍需更多机构样本验证。
来源:同花顺财经
德勤给出银行 AI 全生命周期审计路径,台账完整度成为首要缺口
德勤将银行 AI 审计覆盖到需求、数据、开发、验证、部署、监测和退出,并要求把业务场景、模型、人员与第三方供应链作为同一运行链检查。其 16 国 135 人调研中,72% 受访银行录入中央台账的 AI 场景不足实际数量一半,仅 44% 对 Agent 做全生命周期风险监测;该样本不能直接代表中国银行业。
来源:德勤
Coinbase 与 Moov 把稳定币通道接入 1,000 多家社区银行
Coinbase 与 Moov 宣布向 1,000 多家小型和社区银行开放稳定币受理、结算和实时资金能力,并称银行无需更换现有技术栈。与普通合作不同,这次新增的是可嵌入既有银行系统的稳定币基础设施;后续要看支持币种、结算边界、合规责任和实际启用机构数。
来源:Coinbase
Bybit 为 AI 交易工具建立与主余额隔离的子账户
Bybit 上线用于交易和账户管理的 AI 工具,启用后自动建立独立 AI 子账户,与用户主余额隔离。这个设计把 Agent 的资金权限限制在单独账户,降低错误操作波及全部资产的范围;正式材料未披露额度、撤销机制和模型决策边界,仍需产品规则补充。
来源:Tech in Asia
硬件与算力
层 Dropout 最高减少 25% 训练 FLOPs,并带来 1.5 倍推理加速
Cerebras 与 MBZUAI 的研究在训练时随机跳过部分层,报告最多节省 25% 训练 FLOPs,并实现最高 1.5 倍推理速度。正式材料没有列出模型规模、数据集、精度损失和硬件条件,因此这些是最佳条件结果;是否能在不同深度、不同架构上保持质量是复现重点。
来源:Cerebras
微软据称计划到 2032 年把数据中心容量由 12GW 扩至 38GW 以上
Bloomberg 援引消息人士称,微软计划把数据中心容量从当前约 12GW 提高到 2032 年的 38GW 以上,其中约三分之一围绕 AI 专用芯片建设;供给短缺此前已迫使公司放弃部分 AI 和云业务。规模意味着电网接入和供电可靠性会与芯片供应同样成为交付约束。