FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-09-11

Agent 从“会回答”进入“可托管、可接数据、可审计”的生产阶段

降低FOMO的每日信息交付

2026-09-11 前沿科技洞见 · 日报

📊 今日关键数据

🔍 今日值得深读

OpenAI 公测 Agents API,把 Codex 的长程运行框架开放给开发者

OpenAI 将支撑 Codex 的托管 Agent 框架封装为公开测试版 API:系统负责上下文管理、工具调用和子 Agent 编排,任务可持续运行数天;开发者可选 OpenAI 沙箱、自有基础设施或合作方沙箱。早期用户 Ciridae 报告评测分数由 0.71 升至 0.85,多子 Agent 流程延迟降低 4 倍。

来源:OpenAI

GPT-Live-1 用单模型全双工音频减少语音 Agent 的脆弱交接

OpenAI 在 API 上推出 GPT-Live-1,让同一模型同时处理输入与输出音频,避开 STT—LLM—TTS 串联架构的延迟和交接故障;它还可把深度推理与工具调用委托给后端文本模型。Speak 的早期评估显示,相比旧式轮流对话系统,模型误打断学习者的次数减少近 80%。

来源:OpenAI

AutoScientist-Quant 把搜索反馈与最终测试隔离,修复量化 Agent 的回测泄漏

Google 与剑桥研究者检查 AlphaAgent、QuantaAlpha 后发现:指标计算曾使用全样本,时间筛选逻辑也会让模型在训练时段接受评价。AutoScientist-Quant 因此把数据分成训练、验证、搜索反馈和最终测试四段,让 Agent 只能在 2021 年 6 月至 2023 年 6 月的反馈窗迭代,2023 年 6 月至 2026 年 5 月留作独立检验。

来源:QuantML

京东开源 EchoWM,把可交互世界扩展到同步视听与跨视角控制

京东探索研究院开源 JoyAI-EchoWM:模型在一套框架内持续生成画面、环境音、音乐和语音,并响应第一、第三人称的相机与主体操作。论文报告在 158 个 WBench Navigation 案例上取得 81.7 平均分,一致性 89.8、交互性 87.2;四步因果流式版本 EchoWM-Flash 得分 81.0。

来源:AI提效手册

DrugEvolve 让 Agent 自主改写、训练和复盘药物算法

浙江大学、上海交通大学和上海创智学院团队提出 DrugEvolve。研究者提供任务、数据、基线算法和目标后,Researcher、Engineer、Analyst 三类角色依次设计方案、实现和训练代码、分析成败,再把文献知识与每轮实验记录写入长期资源,形成持续迭代闭环。

来源:BAAI 智源

Alpha-R1 用语义门控筛选与市场状态匹配的配置思路

财跃星辰与上海交大开源 8B 金融推理模型 Alpha-R1。模型先结合决策时点前的行情和财经新闻生成市场状态,再用“语义门控”匹配候选配置逻辑;两阶段训练先由数值方法生成候选池,再以 GRPO 和模拟收益信号训练模型复筛。

来源:财联社 AI Daily

📰 独立报道

AGI、Agent 与评测

OpenResearcher 以离线研究轨迹训练 30B 开放模型,BrowseComp-Plus 得分 54.8%

Lambda 披露,OpenResearcher 完全使用离线研究轨迹训练,BrowseComp-Plus 得分比基座高 34 分,并超过其列出的 GPT-4.1、Claude-4-Opus 与 DeepSeek-R1;模型还迁移到实时网络任务。正式材料未给出硬件、成本和失败类别,结论仍需论文与独立复现补齐。

来源:Lambda

AgentGrad 用顺序干预优化多 Agent 提示词,报告 2.5 倍加速

AgentGrad 逐一干预多 Agent 系统组件,再把结果抽象成语义文本梯度,用于定位和改写提示词。作者报告该方法在 5 个多 Agent 基准达到新的最佳成绩,优化速度提高 2.5 倍;正式材料未披露各基准分数、模型和预算条件,跨模型泛化仍待核验。

来源:HuggingPapers

Polaris-Bench 用极坐标重写 53 项任务,检查视觉推理是否依赖笛卡尔捷径

Google DeepMind 在 Hugging Face 发布 Polaris-Bench,将 53 项视觉推理任务改写到极坐标表示,以削弱模型从常见横纵坐标布局中套用模式的机会。当前正式材料只给出任务设计,尚无模型排行和误差拆解;它更适合作为检验坐标表征鲁棒性的新增测试集。

来源:HuggingPapers

WearableQA 用 200 名用户真实可穿戴数据构造 4,084 道十选一问题

Meta 发布 WearableQA,以 200 名用户的日常健康信号构造 4,084 道十选一问题,测试模型跨时间解释活动与生理数据的能力。正式输入没有列出模型基线、准确率和隐私处理方法,因此当前价值主要在真实数据分布与多选难度设计,不能据此判断模型能力高低。

来源:HuggingPapers

Show-Harness 用语义接口让 VLM 零样本控制两类真实机械臂

新加坡国立大学 Show Lab 提出紧凑语义接口,使前沿 VLM 可零样本控制 Franka 与 AgileX 真机,小型开放模型则用不足 1 个 H200 GPU 小时微调获得控制能力。材料未给出任务成功率和安全失败类型,后续需比较接口抽象带来的迁移收益与动作精度损失。

来源:HuggingPapers

宇树开源 UnifoLM-WLA-1.0,用同一模型协调桌面与全身移动操作

宇树开源升级版具身基础模型 UnifoLM-WLA-1.0,覆盖桌面操作与全身移动操作,并支持跨任务、跨末端执行器泛化。官方称其在多个开放模型基准达到新最佳成绩,但正式材料没有逐项分数与硬件条件;实际价值要看权重、数据和真机评测能否完整复现。

来源:Unitree

可编程世界模型把状态演化、持久记忆和视频渲染拆成三层

Alaya Lab 的方案不让视频模型独自承担世界一致性:Agent 编写可执行规则,持久状态引擎跟踪画面外实体,视频模型只负责渲染。这种分层结构便于明确规则和调试隐藏状态,但正式材料尚未提供长程一致性指标与速度成本,仍需与端到端世界模型对照。

来源:HuggingPapers

AI 战略与工程

Anthropic 披露针对 Claude 的大规模蒸馏活动

Anthropic 称,DeepSeek、Moonshot 等公司通过境外“中转站”、数千个虚假账户和数百万条真实用户查询,试图蒸馏 Claude 能力;TechCrunch 将其描述为近期持续升级的活动。相关数字与归因来自 Anthropic 单方报告,外部尚无独立技术复核。

来源:Techmeme / Wall Street Journal · TechCrunch

Anthropic 把模型滥用监测扩展到网络攻击、监控和生物风险

Anthropic 发布威胁情报报告,列出其阻断的网络行动、监控、影响行动、常规武器、生物滥用、诈骗及非法蒸馏案例。公司另称曾中止可能帮助生物武器研发的研究,但无法判断其合法或恶意目的;边界问题在于安全团队需要依据有限上下文暂停高风险科研。

来源:Techmeme / Anthropic

Google Cloud 把云端知识与工具封装成可安装的编码 Agent 插件

Google Cloud 发布面向 AI 编码 Agent 的插件包,让不同 Agent 安装针对 Google Cloud 的技能和工具。它把云文档、操作入口和工作流从临时提示词转成可分发组件;后续需观察支持的 Agent 范围、凭证隔离方式,以及插件升级时对既有自动化的兼容性。

来源:Google CloudTech

Slackforce Surfaces 允许在对话中生成可交互报表和微型应用

Slack 新功能可让 Slackbot 从相关对话及 Google Drive、Salesforce 等连接应用收集信息,再在聊天中生成报表、投票、仪表盘、演示或微型网站。产品把企业协作中的“找数据—写代码—发布界面”压成一条对话工作流,权限继承和生成结果校验将决定能否安全落地。

来源:The Verge

加州限制未成年人使用成瘾式功能及与聊天机器人的交互

加州州长 Gavin Newsom 签署一组儿童网络保护法案,限制 16 岁以下用户接触被认定为“成瘾性”的社交功能,并约束未成年人和聊天机器人的互动。对产品团队而言,变化落在年龄识别、交互限制和未成年人体验分流;具体生效日期与实施细则仍需跟进。

来源:Techmeme / CalMatters

资管金融与区块链

ChatGPT for Financial Services 内置金融数据与逐项来源追踪

OpenAI 推出面向金融机构的 ChatGPT Work 版本,由 Morgan Stanley 和 Evercore 参与设计,内置 Daloopa、PitchBook、LSEG News、Crunchbase 等数据,用于研究、建模和客户材料。数据由 OpenAI 索引托管,并提供细粒度引用与企业级连接、权限和治理控制,目前只向符合条件的机构开放。

来源:OpenAI

蚂蚁数科 Agentar 金融版用 2,000 多项指标管理岗位级 Agent

蚂蚁数科发布 Agentar 金融版,预置覆盖财富管理、投顾和零售经营的十大数字专家团,并统一管理模型、Agent、技能和任务流程。平台称内置 2,000 多项金融评测指标及双向安全校验;某试点报告客户活跃度提升 15%、单人服务量提高 5 倍以上,仍需更多机构样本验证。

来源:同花顺财经

德勤给出银行 AI 全生命周期审计路径,台账完整度成为首要缺口

德勤将银行 AI 审计覆盖到需求、数据、开发、验证、部署、监测和退出,并要求把业务场景、模型、人员与第三方供应链作为同一运行链检查。其 16 国 135 人调研中,72% 受访银行录入中央台账的 AI 场景不足实际数量一半,仅 44% 对 Agent 做全生命周期风险监测;该样本不能直接代表中国银行业。

来源:德勤

Coinbase 与 Moov 把稳定币通道接入 1,000 多家社区银行

Coinbase 与 Moov 宣布向 1,000 多家小型和社区银行开放稳定币受理、结算和实时资金能力,并称银行无需更换现有技术栈。与普通合作不同,这次新增的是可嵌入既有银行系统的稳定币基础设施;后续要看支持币种、结算边界、合规责任和实际启用机构数。

来源:Coinbase

Bybit 为 AI 交易工具建立与主余额隔离的子账户

Bybit 上线用于交易和账户管理的 AI 工具,启用后自动建立独立 AI 子账户,与用户主余额隔离。这个设计把 Agent 的资金权限限制在单独账户,降低错误操作波及全部资产的范围;正式材料未披露额度、撤销机制和模型决策边界,仍需产品规则补充。

来源:Tech in Asia

硬件与算力

层 Dropout 最高减少 25% 训练 FLOPs,并带来 1.5 倍推理加速

Cerebras 与 MBZUAI 的研究在训练时随机跳过部分层,报告最多节省 25% 训练 FLOPs,并实现最高 1.5 倍推理速度。正式材料没有列出模型规模、数据集、精度损失和硬件条件,因此这些是最佳条件结果;是否能在不同深度、不同架构上保持质量是复现重点。

来源:Cerebras

微软据称计划到 2032 年把数据中心容量由 12GW 扩至 38GW 以上

Bloomberg 援引消息人士称,微软计划把数据中心容量从当前约 12GW 提高到 2032 年的 38GW 以上,其中约三分之一围绕 AI 专用芯片建设;供给短缺此前已迫使公司放弃部分 AI 和云业务。规模意味着电网接入和供电可靠性会与芯片供应同样成为交付约束。

来源:Techmeme / Bloomberg