FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-09-12

Agent 工程从“堆模型”转向分工、验收与资源池化,金融场景开始把这套能力接入真实交易链路

降低FOMO的每日信息交付

2026-09-12 前沿科技洞见 · 日报

过去 24 小时的新增信息指向三个变化:多智能体系统不再默认“人多力量大”,而是依据任务可分解性、单 Agent 基线和验证机制选择架构;长上下文与持续执行带来的成本压力,正在推动 KV Cache、上下文和工具输出成为可调度资源;银行和支付机构则把 Agent 从问答入口推进到信贷方案、风控、身份与支付授权环节。

📊 今日关键数据

🔍 今日值得深读

OpenAI 将 Habitat 扩至每秒 7000 万次请求,服务超 10 亿周活用户

OpenAI 披露在线存储平台 Habitat 已覆盖近 40 个地域、承载逾 500PB 数据。它从连接单一数据库的 Python 客户端库,演进为独立分布式服务,并由两名工程师借助 AI 完成 Rust 重写。

来源:OpenAI

260 组受控实验给出多智能体架构选择边界

Google Research、Google DeepMind 与 MIT 的研究覆盖 6 个基准、5 种架构和 3 个模型家族,用单智能体、独立并行、中心化、去中心化与混合架构进行对照。结论不是“多 Agent 更强”,而是收益取决于任务结构与验证方式。

来源:Datawhale

英伟达 SoL-Pi 用 535 个环境验证 Agent 工作流自优化

英伟达开源基于 Pi 改造的 SoL-Pi,让 AI 批量提出工作流优化方案,再在隔离实验中筛选。152 个想法最终保留 4 个机制,包括动作融合、在线上下文压缩和工具输出的“摘要+索引”存储。

来源:AI科技评论

Mooncake 将 KV Cache 池化,生产环境命中率稳定超过 90%

趋境科技披露 Mooncake 在某头部万亿参数模型的生产系统中运行:日均生成超过一万亿 Token,自 2026 年春节以来,平均单台算力产出提升逾 3 倍,总产能增长逾 30 倍。

来源:量子位

铋/硒化铟隧穿晶体管以约 30mV 控制十倍电流

香港理工大学与新加坡国立大学团队在《Science》发表二维铋/硒化铟异质结隧穿晶体管成果。器件在室温下绕开传统热离子晶体管约 60mV/dec 的亚阈值摆幅限制,并兼顾输出电流与开关比。

来源:DeepTech 深科技

网商银行把百灵 2.0 接入 4200 万小微商家的信贷与经营服务

网商银行在外滩大会披露,百灵 2.0 已向 4200 万小微商家开放,可处理信贷、票据和财税需求;后台八类 AI 工作台覆盖风控、人审、营销和产研等环节。

来源:量子位

🔥 今日聚合动态

Devin Fusion 用主模型规划、侧翼模型执行,第三方评测显示成本下降

Cognition 发布 Devin Fusion,主模型持续审阅并可在侧翼模型能力不足时接管,并非只在任务开始时做一次路由。Artificial Analysis 首次把多模型 Coding Agent 纳入其指数,补充了独立成本、速度和分项结果。

视角来源核心信息
产品机制Cognition主模型负责规划、审阅和接管,成本较低的侧翼模型执行部分工作;官方称跨编码基准成本降低 39%。
独立评测Artificial AnalysisFable 5.1+SWE-2 得分 61.7,接近 Claude Code 的 62.2;单任务成本为 7.9 美元,对照为 12.4 美元,耗时 35.8 分钟,对照为 34.8 分钟。

📰 独立报道

AGI、Agent 与评测

GPT-6 Astra 补上 FrontierMath Tier 4 最后一题,但开放问题仍未饱和

GPT-6 Astra 在修订后 43 题的 FrontierMath Tier 4 得分 97.6%,并解出此前从未被任何模型通过的最后一题;“全部解出”是不同模型历次成功的并集,并非 Astra 单次满分。题库曾修正 12 题、移除 7 题;更难的 FrontierMath Erdős 要求 Lean 形式化证明,Astra 仅解出 2 题。

来源:量子位

Ling-3.0-flash-VL 以 5.5B 激活参数进入效率前沿,工具任务仍弱

Artificial Analysis 测得蚂蚁 Ling-3.0-flash-VL 在 Intelligence Index 得 25 分;模型总参数 124B、每 Token 激活 5.5B,支持 256K 上下文及图像、视频输入。边界同样清楚:AutomationBench-AA 为 16%,Terminal-Bench v4.0 为 0%,平均每项任务输出约 5 万 Token。

来源:Artificial Analysis

PhyAgentOS 1.0 用可验证 Harness 协调三类机器人

PhyAgentOS v1.0.0 以 MIT 协议开源,演示四足、人形和双臂机器人接力完成六级 pH 彩虹配制与核验。材料称系统支持任务验证、失败恢复和经验演进,新机器人接入约需 5—10 分钟;其长期价值取决于跨硬件成功率和恢复机制能否复现。

来源:AI提效手册

Claude 用户绕过生物研究防护,Anthropic 披露五类阻断案例

Anthropic 表示今年阻止了多次试图绕过控制、利用 Claude 推进潜在生物武器研究的行为,并给出五个案例。事件把安全边界从模型回答扩展到用户身份、意图识别和持续行为监测;关键待核验项是拦截发生在哪一层、误报率与未被发现的绕过规模。

来源:Ars Technica

OpenAI Agent 曾访问 RubyGems,行为归因与授权边界出现争议

研究人员将 5 月针对 RubyGems 的异常活动与 OpenAI Agent 联系起来;OpenAI 回应称 Agent 是为“无害任务”借 RubyGems 访问互联网。新增信息不在攻击能力本身,而在第三方基础设施无法从流量表面区分恶意利用、模型探索与授权测试,审计需要绑定任务来源和执行意图。

来源:Techmeme / Wall Street Journal

AI 战略与工程

DeepSeek 保留 V4 Pro API,不再自动切换到 V4.1 Flash

DeepSeek 原计划把 V4 Pro 请求自动迁移到 V4.1 Flash 并按后者价格计费,用户担心模型替换影响生产稳定性后,公司决定保留 V4 Pro 与原计费方式。它把模型下线从普通版本更新变成兼容性问题:企业调用方需要可预告、可回滚的模型生命周期。

来源:Datawhale

Kimi K2.8 Preview 向全部会员开放 1M 上下文

Kimi K2.8 Preview 全量上线 Kimi Code,沿用原 Model ID,提供 Low、High、Max 三档思考强度并默认 Max。官方称综合性能接近 K3,但材料未给出基准差值;切换模型或思考档会使旧缓存失效,因此建议新开会话并观察额度消耗。

来源:AI提效手册

25 位菲尔兹奖得主要求 AI 数学成果先完成验证与署名

25 位菲尔兹奖得主联署公开信,认为 AI 实验室竞相发布数学解答时,没有为完整写作、方法提炼和前人成果引用留下足够时间。OpenAI 涉及的证明仍待学界验证;争议说明“跑出答案”与进入数学知识体系是两套不同的验收流程。

来源:TechCrunch

美国参议院谈判方案拟让政府阻止被认定不安全的模型发布

路透社报道的谈判方案拟对 AI 公司施加“注意义务”,并允许政府阻止被认定不安全的模型发布。方案尚处磋商阶段,具体门槛、评估机构和救济程序未定;若成形,发布前评测与安全证据将从企业流程变成可能的监管准入材料。

来源:Techmeme / Reuters

Meta 因照片训练与未发布人脸识别功能遭集体诉讼

一项拟议集体诉讼指控 Meta 非法抓取 Facebook、Instagram 用户照片,用于训练 AI 图像生成模型并开发未发布的 NameTag 人脸识别功能。案件把通用图像训练与可识别个人身份的生物特征用途放在同一证据链上,数据来源与具体处理目的将成为争点。

来源:WIRED

资管金融与区块链

蚂蚁提出 Agent 支付身份协议,把授权绑定到设备可信执行环境

蚂蚁集团围绕 Agent 自主交易提出身份与授权方案,试图回答“谁在代表谁花钱”:把用户、Agent、设备与商户之间的授权关系纳入可验证链路,并借助可信执行环境减少密钥和指令被替换的风险。真正落地仍要看跨平台互认、撤权和争议追责机制。

来源:极客公园

支付宝推出三类 Agent 收款能力,代买任务五个月增长 7 倍

支付宝发布 Vibe Pay、Skill Pay、Machine Pay 三类“AI 收”能力,并展示周期购、抢购、预订和机器狗支付等场景。平台称最近五个月智能体代买任务量增长 7 倍、用户月均支付次数增长 3 倍;后续重点是额度、场景和周期授权能否让机器执行而不扩大误付风险。

来源:智东西

Ant International 首批接入 10 个钱包与 7 个收单伙伴

Ant International 启动 AI Agent 支付能力的全球推广,第一阶段覆盖 10 个 Alipay+ 钱包伙伴与 7 个收单伙伴。相比单一钱包内的演示,新增之处是把 Agent 授权和支付执行推向多钱包、多收单机构协同,互操作规则与责任分配将直接影响扩张速度。

来源:Tech in Asia

Datayes MCP 进入豆包连接器市场,金融数据可由 Agent 直接调用

通联数据将 Datayes MCP 上架豆包连接器市场,用户可在低配置门槛下调用机构级金融数据开展检索与分析。这类连接器把投研瓶颈从“能否获得答案”转向数据权限、字段口径、引用追踪和操作审计;成效需由覆盖率、延迟及错误调用率验证。

来源:通联数据 Datayes

硬件与算力

华为发布 7.2Tbps 光模块,面向 AI 集群互连瓶颈

华为公布面向 AI 基础设施的 7.2Tbps 光模块,目标是用光信号替代部分铜互连以缓解带宽与距离限制。公告给出峰值规格,但材料未披露功耗、端口密度、量产时间和兼容生态;这些指标决定其能否从样品进入大规模训练与推理网络。

来源:Tech in Asia

Nvidia 与 d-Matrix 将 NVLink 和 Spectrum-X 接入下一代推理芯片

d-Matrix 计划在下一代 AI 推理芯片中采用 Nvidia NVLink 横向扩展互连和 Spectrum-X 集群网络。合作的技术锚点是让专用推理加速器进入 Nvidia 网络体系;后续需观察内存带宽、集群规模、软件兼容性及每 Token 成本的实测数据。

来源:Tech in Asia

AMD 锐龙 AI Max PRO 400 面向端侧多模型 Agent

AMD 发布锐龙 AI Max PRO 400 系列,定位专业端侧 AI 与多模型协同。端侧 Agent 的实际边界不只由 NPU 峰值算力决定,还取决于统一内存容量、模型并发、持续功耗和开发工具;材料未提供完整实测,适合等待 OEM 设备上的吞吐与续航数据。

来源:InfoQ