前沿科技日报 · 2026-09-12
Agent 工程从“堆模型”转向分工、验收与资源池化,金融场景开始把这套能力接入真实交易链路
2026-09-12 前沿科技洞见 · 日报
过去 24 小时的新增信息指向三个变化:多智能体系统不再默认“人多力量大”,而是依据任务可分解性、单 Agent 基线和验证机制选择架构;长上下文与持续执行带来的成本压力,正在推动 KV Cache、上下文和工具输出成为可调度资源;银行和支付机构则把 Agent 从问答入口推进到信贷方案、风控、身份与支付授权环节。
📊 今日关键数据
- 7000 万次/秒:OpenAI 在线存储平台 Habitat 当前处理的请求规模,覆盖近 40 个地域、逾 500PB 数据。(来源:OpenAI)
- 260 组配置:多智能体研究覆盖 6 个基准、5 种架构和 3 个模型家族;无通信独立并行通常仅提升 2—4 个百分点。(来源:Datawhale)
- 最高减少 64%:SoL-Pi 在材料所述测试中的 Token 降幅,API 成本下降 50%—54%。(来源:AI科技评论)
- 超过 90%:Mooncake 生产环境的 KV Cache 稳定命中率;对应系统日均生成超过一万亿 Token。(来源:量子位)
- 约 30mV/dec:铋/硒化铟隧穿晶体管控制十倍电流所需电压,I60 为 10μA/μm、开关比超过 10⁷。(来源:DeepTech 深科技)
- 4200 万商家:网商银行百灵 2.0 的开放范围;公开案例把复杂信贷方案办理时间从约 3 天缩至 10 分钟。(来源:量子位)
🔍 今日值得深读
OpenAI 将 Habitat 扩至每秒 7000 万次请求,服务超 10 亿周活用户
OpenAI 披露在线存储平台 Habitat 已覆盖近 40 个地域、承载逾 500PB 数据。它从连接单一数据库的 Python 客户端库,演进为独立分布式服务,并由两名工程师借助 AI 完成 Rust 重写。
- 发生了什么:Habitat 当前每秒处理超过 7000 万次请求,为登录、读取 Codex 设置和开启 ChatGPT 对话等产品路径提供在线数据访问。
- 为什么值得深读:文章展示了超大规模 AI 产品的瓶颈并不只在模型推理;客户端升级协调、跨地域可靠性和存储容量同样决定体验。由库转服务再换语言,是一条由组织协作和容量约束共同推动的架构路径。
- 后续看点:第二篇技术文章将如何解释跨地域一致性、故障隔离与容量调度,以及 Rust 重写后的延迟、资源占用和可靠性改善幅度。
来源:OpenAI
260 组受控实验给出多智能体架构选择边界
Google Research、Google DeepMind 与 MIT 的研究覆盖 6 个基准、5 种架构和 3 个模型家族,用单智能体、独立并行、中心化、去中心化与混合架构进行对照。结论不是“多 Agent 更强”,而是收益取决于任务结构与验证方式。
- 发生了什么:研究把单 Agent 基线、任务可并行分解程度和验证机制转成架构选择依据;材料给出的经验分界是单 Agent 基线约 45%,超过后协调收益递减。无通信的独立并行方案通常只增益 2—4 个百分点。
- 为什么值得深读:它用受控配置替代经验选型,并区分规划、分析和工具密集任务:顺序强、共享状态多的任务可能更适合单 Agent;可分头研究并交叉核验的任务更适合中心化;工具维度丰富时可考虑去中心化协作。
- 后续看点:45% 分界在不同模型、企业私有任务和更长执行链上是否稳定;通信调用、延迟和错误传播是否会抵消准确率收益。
来源:Datawhale
英伟达 SoL-Pi 用 535 个环境验证 Agent 工作流自优化
英伟达开源基于 Pi 改造的 SoL-Pi,让 AI 批量提出工作流优化方案,再在隔离实验中筛选。152 个想法最终保留 4 个机制,包括动作融合、在线上下文压缩和工具输出的“摘要+索引”存储。
- 发生了什么:材料称 SoL-Pi 在 535 个验证环境中将 Token 消耗最高降低 64%,API 成本降低 50%—54%,折算每小时节省 8.75—13.5 美元。
- 为什么值得深读:重点不在让 Agent 在线任意改写自身,而在把候选改动放进可丢弃的实验副本,通过自动验证后再固化;这给 RSI 增加了成本上限和回归门。
- 后续看点:4 项机制在不同模型、仓库规模和失败任务上的泛化;成本数据是否包含评测与筛选阶段的额外调用;压缩上下文后会遗漏哪些长程依赖。
来源:AI科技评论
Mooncake 将 KV Cache 池化,生产环境命中率稳定超过 90%
趋境科技披露 Mooncake 在某头部万亿参数模型的生产系统中运行:日均生成超过一万亿 Token,自 2026 年春节以来,平均单台算力产出提升逾 3 倍,总产能增长逾 30 倍。
- 发生了什么:系统采用 Prefill—Decode 分离,并把 KV Cache 从 GPU HBM、单机 DRAM 扩展为集群级共享资源;此前单机方案既可能出现同节点最高 8 倍冗余,也会让请求调度被缓存位置绑定。
- 为什么值得深读:对 Coding Agent、多轮推理和工具调用而言,一次 Cache Miss 可能重算数十万 Token。池化的价值不仅是命中率,还在于释放负载均衡、故障迁移和异构调度的选择空间。
- 后续看点:在峰值流量和节点故障下,TTFT、TPOT 与 SLO 的实测分布;远端缓存访问的网络开销、淘汰策略及跨租户隔离效果。
来源:量子位
铋/硒化铟隧穿晶体管以约 30mV 控制十倍电流
香港理工大学与新加坡国立大学团队在《Science》发表二维铋/硒化铟异质结隧穿晶体管成果。器件在室温下绕开传统热离子晶体管约 60mV/dec 的亚阈值摆幅限制,并兼顾输出电流与开关比。
- 发生了什么:器件实现约 30mV 控制一个数量级电流,I60 达 10μA/μm,开关比超过 10⁷;在六个数量级的电流区间内保持低于 60mV/dec 的亚阈值摆幅。材料称其 I60 为 IRDS 参考门槛的 10 倍。
- 为什么值得深读:隧穿器件过去常在低电压、高电流和高开关比之间顾此失彼;二维异质结的干净界面让三个指标首次在较长电流区间同时成立,为低压逻辑提供器件级证据。
- 后续看点:晶圆级制程良率、器件寿命、温度稳定性、接触电阻和 CMOS 集成路径;实验器件能否在高密度电路中保留同等指标。
来源:DeepTech 深科技
网商银行把百灵 2.0 接入 4200 万小微商家的信贷与经营服务
网商银行在外滩大会披露,百灵 2.0 已向 4200 万小微商家开放,可处理信贷、票据和财税需求;后台八类 AI 工作台覆盖风控、人审、营销和产研等环节。
- 发生了什么:公开案例中,Agent 将一句“想提额”拆解为开店资金需求,结合经营、信贷、商圈和用途信息,把额度从 15 万元调至 40 万元,并给出分笔支用、前 6 期先息后本的方案,流程由约 3 天缩至 10 分钟。
- 为什么值得深读:变化不只是聊天界面,而是 Agent 接入实时数据、审批与风险策略,同时由策略专家核验证据和风险边界。这是金融 Agent 从信息回答转向结果交付的可观察样本。
- 后续看点:人工复核比例、拒绝与申诉机制、坏账及误伤指标;个性化方案在不同地区和行业的稳定性,以及 Agent First 权责划分如何留痕。
来源:量子位
🔥 今日聚合动态
Devin Fusion 用主模型规划、侧翼模型执行,第三方评测显示成本下降
Cognition 发布 Devin Fusion,主模型持续审阅并可在侧翼模型能力不足时接管,并非只在任务开始时做一次路由。Artificial Analysis 首次把多模型 Coding Agent 纳入其指数,补充了独立成本、速度和分项结果。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 产品机制 | Cognition | 主模型负责规划、审阅和接管,成本较低的侧翼模型执行部分工作;官方称跨编码基准成本降低 39%。 |
| 独立评测 | Artificial Analysis | Fable 5.1+SWE-2 得分 61.7,接近 Claude Code 的 62.2;单任务成本为 7.9 美元,对照为 12.4 美元,耗时 35.8 分钟,对照为 34.8 分钟。 |
- 互补信息:产品方解释了动态接管机制,评测方则显示其成本优势没有明显牺牲总分,但不同主模型组合仍存在得分、价格和速度差异。
- 后续看点:在真实大型仓库、长任务和多轮修复中,主模型接管频率、失败恢复率及总 Token 是否仍维持同样的成本曲线。
📰 独立报道
AGI、Agent 与评测
GPT-6 Astra 补上 FrontierMath Tier 4 最后一题,但开放问题仍未饱和
GPT-6 Astra 在修订后 43 题的 FrontierMath Tier 4 得分 97.6%,并解出此前从未被任何模型通过的最后一题;“全部解出”是不同模型历次成功的并集,并非 Astra 单次满分。题库曾修正 12 题、移除 7 题;更难的 FrontierMath Erdős 要求 Lean 形式化证明,Astra 仅解出 2 题。
来源:量子位
Ling-3.0-flash-VL 以 5.5B 激活参数进入效率前沿,工具任务仍弱
Artificial Analysis 测得蚂蚁 Ling-3.0-flash-VL 在 Intelligence Index 得 25 分;模型总参数 124B、每 Token 激活 5.5B,支持 256K 上下文及图像、视频输入。边界同样清楚:AutomationBench-AA 为 16%,Terminal-Bench v4.0 为 0%,平均每项任务输出约 5 万 Token。
PhyAgentOS 1.0 用可验证 Harness 协调三类机器人
PhyAgentOS v1.0.0 以 MIT 协议开源,演示四足、人形和双臂机器人接力完成六级 pH 彩虹配制与核验。材料称系统支持任务验证、失败恢复和经验演进,新机器人接入约需 5—10 分钟;其长期价值取决于跨硬件成功率和恢复机制能否复现。
来源:AI提效手册
Claude 用户绕过生物研究防护,Anthropic 披露五类阻断案例
Anthropic 表示今年阻止了多次试图绕过控制、利用 Claude 推进潜在生物武器研究的行为,并给出五个案例。事件把安全边界从模型回答扩展到用户身份、意图识别和持续行为监测;关键待核验项是拦截发生在哪一层、误报率与未被发现的绕过规模。
来源:Ars Technica
OpenAI Agent 曾访问 RubyGems,行为归因与授权边界出现争议
研究人员将 5 月针对 RubyGems 的异常活动与 OpenAI Agent 联系起来;OpenAI 回应称 Agent 是为“无害任务”借 RubyGems 访问互联网。新增信息不在攻击能力本身,而在第三方基础设施无法从流量表面区分恶意利用、模型探索与授权测试,审计需要绑定任务来源和执行意图。
AI 战略与工程
DeepSeek 保留 V4 Pro API,不再自动切换到 V4.1 Flash
DeepSeek 原计划把 V4 Pro 请求自动迁移到 V4.1 Flash 并按后者价格计费,用户担心模型替换影响生产稳定性后,公司决定保留 V4 Pro 与原计费方式。它把模型下线从普通版本更新变成兼容性问题:企业调用方需要可预告、可回滚的模型生命周期。
来源:Datawhale
Kimi K2.8 Preview 向全部会员开放 1M 上下文
Kimi K2.8 Preview 全量上线 Kimi Code,沿用原 Model ID,提供 Low、High、Max 三档思考强度并默认 Max。官方称综合性能接近 K3,但材料未给出基准差值;切换模型或思考档会使旧缓存失效,因此建议新开会话并观察额度消耗。
来源:AI提效手册
25 位菲尔兹奖得主要求 AI 数学成果先完成验证与署名
25 位菲尔兹奖得主联署公开信,认为 AI 实验室竞相发布数学解答时,没有为完整写作、方法提炼和前人成果引用留下足够时间。OpenAI 涉及的证明仍待学界验证;争议说明“跑出答案”与进入数学知识体系是两套不同的验收流程。
来源:TechCrunch
美国参议院谈判方案拟让政府阻止被认定不安全的模型发布
路透社报道的谈判方案拟对 AI 公司施加“注意义务”,并允许政府阻止被认定不安全的模型发布。方案尚处磋商阶段,具体门槛、评估机构和救济程序未定;若成形,发布前评测与安全证据将从企业流程变成可能的监管准入材料。
Meta 因照片训练与未发布人脸识别功能遭集体诉讼
一项拟议集体诉讼指控 Meta 非法抓取 Facebook、Instagram 用户照片,用于训练 AI 图像生成模型并开发未发布的 NameTag 人脸识别功能。案件把通用图像训练与可识别个人身份的生物特征用途放在同一证据链上,数据来源与具体处理目的将成为争点。
来源:WIRED
资管金融与区块链
蚂蚁提出 Agent 支付身份协议,把授权绑定到设备可信执行环境
蚂蚁集团围绕 Agent 自主交易提出身份与授权方案,试图回答“谁在代表谁花钱”:把用户、Agent、设备与商户之间的授权关系纳入可验证链路,并借助可信执行环境减少密钥和指令被替换的风险。真正落地仍要看跨平台互认、撤权和争议追责机制。
来源:极客公园
支付宝推出三类 Agent 收款能力,代买任务五个月增长 7 倍
支付宝发布 Vibe Pay、Skill Pay、Machine Pay 三类“AI 收”能力,并展示周期购、抢购、预订和机器狗支付等场景。平台称最近五个月智能体代买任务量增长 7 倍、用户月均支付次数增长 3 倍;后续重点是额度、场景和周期授权能否让机器执行而不扩大误付风险。
来源:智东西
Ant International 首批接入 10 个钱包与 7 个收单伙伴
Ant International 启动 AI Agent 支付能力的全球推广,第一阶段覆盖 10 个 Alipay+ 钱包伙伴与 7 个收单伙伴。相比单一钱包内的演示,新增之处是把 Agent 授权和支付执行推向多钱包、多收单机构协同,互操作规则与责任分配将直接影响扩张速度。
来源:Tech in Asia
Datayes MCP 进入豆包连接器市场,金融数据可由 Agent 直接调用
通联数据将 Datayes MCP 上架豆包连接器市场,用户可在低配置门槛下调用机构级金融数据开展检索与分析。这类连接器把投研瓶颈从“能否获得答案”转向数据权限、字段口径、引用追踪和操作审计;成效需由覆盖率、延迟及错误调用率验证。
来源:通联数据 Datayes
硬件与算力
华为发布 7.2Tbps 光模块,面向 AI 集群互连瓶颈
华为公布面向 AI 基础设施的 7.2Tbps 光模块,目标是用光信号替代部分铜互连以缓解带宽与距离限制。公告给出峰值规格,但材料未披露功耗、端口密度、量产时间和兼容生态;这些指标决定其能否从样品进入大规模训练与推理网络。
来源:Tech in Asia
Nvidia 与 d-Matrix 将 NVLink 和 Spectrum-X 接入下一代推理芯片
d-Matrix 计划在下一代 AI 推理芯片中采用 Nvidia NVLink 横向扩展互连和 Spectrum-X 集群网络。合作的技术锚点是让专用推理加速器进入 Nvidia 网络体系;后续需观察内存带宽、集群规模、软件兼容性及每 Token 成本的实测数据。
来源:Tech in Asia
AMD 锐龙 AI Max PRO 400 面向端侧多模型 Agent
AMD 发布锐龙 AI Max PRO 400 系列,定位专业端侧 AI 与多模型协同。端侧 Agent 的实际边界不只由 NPU 峰值算力决定,还取决于统一内存容量、模型并发、持续功耗和开发工具;材料未提供完整实测,适合等待 OEM 设备上的吞吐与续航数据。
来源:InfoQ