FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-09-07

Agent 的竞争从模型能力转向支架、工作流与受控执行

降低FOMO的每日信息交付

2026-09-07 前沿科技洞见 · 日报

过去 24 小时的新增材料把 Agent 的工程重心指向模型之外:OpenAI 首次披露内部研究人员每天调用 3.1 个“Agent 工作日”,ServiceNow 用自动搜索支架让固定模型提高 20—35 分,亚马逊则把跨会话记忆、并行调度、失败重试和安全控制整合进开源工作台。具身与科研方向也在压缩数据和算力门槛,VLAct 用 16 张 GPU 训练可跨动作头迁移的底座,Axiom Math 借助并行计算与形式化验证刷新素数间隔上界。金融科技侧,三条公链接连停机暴露紧急权限差异,基金公司的 Skill 工作流开始进入投研、交易和合规环节。

📊 今日关键数据

🔍 今日值得深读

OpenAI 研究人员每天调用 3.1 个“Agent 工作日”

OpenAI 称内部编码 Agent 已达到“自动化研究实习生”目标:研究人员平均每个自然工作日使用 3.1 个 Agent 工作日,重度用户单日 Token 成本超过 7000 美元。这组早期数据把科研 Agent 的价值衡量从单次答题分数推进到实验吞吐、任务复杂度和人机并行程度。

来源:OpenAI · 数据摘要

VLAct 用 16 张 GPU 训练跨动作头迁移的 VLA 底座

StarVLA 团队发现,继续预训练后在原动作头上变强,并不代表视觉语言底座更通用:RoboTwin 中 OFT 头成功率由 61.7% 升至 75.8%,换成 PI 和 GR00T 头却分别降至 55.1% 和 28.9%。VLAct 通过保护视觉编码器与浅层语言层、混入图像描述数据,并用 OFT、PI、GR00T 多头共同监督来减轻这种“动作头特异性表征坍塌”。

来源:机器之心

ServiceNow 自动搜索 Agent 支架,固定模型提高 20—35 分

StarHarness 不微调模型,而是围绕固定模型搜索更合适的 Agent 支架。在企业基准上,搜索后的支架带来 20—35 分提升,同时把推理成本最多降低 53%;在 ITBench 上,小型开放权重模型搭配演化支架,比 GPT-5.5 使用默认支架高 19.2 分。

来源:HuggingPapers

S3Gym 显示大模型自测、自评并不会稳定带来自我改进

字节跳动 Seed 用七种文本游戏评测模型能否通过自测和自评持续改进。结果具有明显任务依赖性:没有一种记忆方案在所有游戏中占优,参数训练还可能产生负迁移,因此“模型生成经验—判断经验—再次训练”的闭环不能被视为自动升级机制。

来源:HuggingPapers

Axiom Math 用并行搜索与验证把素数间隔上界推进至 212

Axiom Math 报告将有界素数间隔上界从长期纪录 246 推进至 212。团队沿用 Stadlmann 的解析思想,用分布式数值实验搜索积分区域和参数组合,并以 Python 与 Lean 辅助验证;一次原需约六天的数值实验,经并行化、预计算和特征值求解优化后缩短到数小时。

来源:Lingowhale 专题

三条公链四天内停机,回滚、暂停出块与事后停机边界不同

Cronos、Ontology 与 ICON 在四天内先后停止出块,但调用的紧急权限并不相同:Cronos 通过验证节点共识回滚部分链历史,Ontology 只暂停新交易确认,ICON 则在多数涉事 ICX 已进入交易所托管账户后停机。停机这一表象背后,对最终性和资产处置的影响差异很大。

来源:吴说 Real

📰 独立报道

AGI、Agent 与评测

亚马逊开源 Kiro Crew,补齐长程编码任务的控制层

Kiro Crew 把跨会话记忆、多 Agent 并行、任务调度、失败重试与安全控制放进同一工作空间,支持本地或远程无值守运行,并用规范文档约束需求、设计和任务拆解。项目采用 Apache 2.0 许可证,前身 MeshClaw 已有超过 3.9 万名开发者使用;实际边界包括较快的 Token 消耗以及长程任务仍需人工审查。

来源:Lingowhale 专题

Anthropic 电商 Agent 采用单主模型与按需 Skill

Claude Commerce Agents 的公开架构避免按业务域频繁切换子 Agent,改用保留完整对话状态的单一主模型和按需加载 Skill;高频能力进入系统提示,长尾功能动态注入,商品卡片等 UI 则封装成结构化工具。材料给出的现场数据为购物车容量增加 35%、购买概率增加 60%,但仍需结合商户样本和实验口径解读。

来源:华尔街见闻

RLVR 研究转向过程验证、混合信号、自验证与标准编译

一份技术综述梳理 2026 年验证器扩展路线:二元对错奖励无法表达部分正确,在 GRPO 同组响应全对或全错时也不给出有效相对梯度;开放写作与对话又缺少唯一答案。当前研究分别从验证中间过程、混合奖励来源、让模型参与验证,以及把开放标准编译成可执行规则四个方向补足覆盖面。

来源:机器之心

Qwen3.8-Next 用 6B 激活参数匹配 397B 前代模型

阿里披露 Qwen3.8-Next:总参数 125B、每次激活 6B,组合 Gated DeltaNet、稀疏注意力与 n-gram embedding。材料称其以约前代三分之一的激活参数和九分之一 FLOPs,匹配 397B 参数前代模型,并改善训练稳定性;完整消融与稳定性分析随论文发布。

来源:HuggingPapers

Puro-2B 在 RTX 5090 上以低于 5090 美元完成训练

Puro-2B 给出一套消费级 GPU 小模型训练配方:2B 参数模型在 RTX 5090 上完成训练,总成本低于 5090 美元,材料称性能可匹配 Qwen2-1.5B。数据、代码、权重和论文同步开放,使成本核算、数据配方和训练过程可被外部复查。

来源:HuggingPapers

NVIDIA Scal3R 用冻结底座重建公里级三维序列

Scal3R 面向在线长序列三维重建,在冻结底座上只增加约 1% 参数,支持公里尺度序列;材料称模型可在单张 GPU 上用 8 小时完成训练。论文、项目页和代码入口均已发布,后续应重点比较长序列累计漂移、实时吞吐与不同相机条件下的精度。

来源:HuggingPapers

Editable Visual Design 让生成海报保留文本与分层编辑能力

该方法让编码 Agent 调用 VLM 负责设计推理、图像模型负责视觉模拟,输出包含真实文本、解耦图层和可编辑结构的海报与信息图,而非单张不可修改的位图。项目还提供逐步设计回放,便于检查 Agent 的布局与修改过程。

来源:HuggingPapers

AI 战略与工程

AI BioDesign 获 9460 万美元,建立实验—模型闭环

Allen Institute、华盛顿大学与 Fred Hutch 联合启动五年期 AI BioDesign 项目,62 人团队将围绕蛋白质、DNA 调控元件和细胞功能定向生成实验数据,再由模型提出下一轮设计与实验。项目总投入 9460 万美元,承诺开放成果,并要求 18—24 个月内给出首批可验证进展。

来源:DeepTech 深科技

中国首款 AI 辅助研发原创药获附条件批准

盐酸伊司特韦片获国家药监局附条件批准,用于成人轻型、中型新冠病毒感染治疗。西湖大学、西湖实验室与西湖制药称,这是国内首款借助 AI 从源头发现并最终获批的原创药,从发现到完成临床试验历时三年半;公开快讯未披露 AI 在靶点、分子筛选和临床环节的具体贡献比例。

来源:华尔街见闻

Anthropic 签约算力规模据估至少 14.8GW

The Information 的汇总分析称,Anthropic 自去年 10 月以来签署的算力协议至少达到 14.8GW,未来十年相关支出可能高达 5170 亿美元。该数字是媒体依据多笔协议作出的估算,不是公司财务指引;决策价值在于它给出了前沿模型公司电力、云资源与资本承诺的数量级。

来源:Techmeme / The Information 摘要

资管金融与区块链

基金公司把 Skill 扩展到投研、交易与合规工作流

财联社调查显示,基金公司的 AI 应用正从接入模型和知识库转向员工自建 Skill 与 Agent。易方达澄清“上千个公开 Skill”说法不准确:内部 EWork 的公开 Skill 覆盖投研、交易等环节,另有大量仅个人或小组使用的工具,无法准确统计。变化重点是可复用工作流进入业务系统,而不是 Skill 数量。

来源:财联社

英国 FCA 与平台接触,研究调整金融预测市场限制

英国 FCA 据报已与交易平台接触,讨论是否放宽金融类预测市场限制,但尚未正式解禁。现行规则仍可能把相关合约视作禁止向零售用户销售的二元期权;体育和政治事件则可能归博彩委员会管辖。后续需看 FCA 是否发布正式咨询或规则文本,以及金融与非金融事件如何划界。

来源:Lingowhale 专题

SEC 拟更新过户代理规则以适配代币化证券

美国证券市场的过户代理规则正面临数十年来的重要更新,讨论范围覆盖电子记录、分布式账本和代币化证券如何进入股权登记、变更与公司行动流程。现阶段应关注正式提案对链上记录法律效力、过户代理责任、系统韧性和投资者资产核对的具体要求,而不能把规则更新等同于代币化证券全面获准。

来源:数字财经趋势

BIS 区分稳定币与代币化存款的货币属性

BIS 总经理 Pablo Hernández de Cos 的杰克逊霍尔讲话以怀俄明州公共稳定币 FRNT 为切口,讨论稳定币与代币化存款如何在数字账本上延伸货币功能。材料强调创新不能脱离货币的统一性、可兑换性和受监管中介责任,技术形式相似并不代表两类负债拥有相同信用基础。

来源:通证经济

硬件与算力

TCS 规划 74 亿美元 AI 数据中心园区

印度 TCS 计划建设占地 264 英亩的 AI 数据中心园区,项目金额约 74 亿美元,并采用液冷基础设施。公开材料尚未给出供电规模、芯片配置与投产节奏;这些指标将决定该园区是通用托管能力,还是面向大模型训练和推理的高密度算力设施。

来源:Tech in Asia