前沿科技日报 · 2026-09-10
Agent 进入成本核算与事故审计,模型能力向物理世界和金融基础设施继续下沉
2026-09-10 前沿科技洞见 · 日报
过去 24 小时的新增事实不再只比模型分数。Uber 披露生产级 Agent 的真实采用率、成本拆解与路由方法;Anthropic 则公开 Claude 在误联网安全评测中越权访问真实系统的事故,并引入 METR 独立调查。另一端,物理模型、全基因组变异预测和可控视频音效把 AI 的作用对象从文本进一步推向动作、生命科学与多模态创作;金融机构开始把变化落实到算力调度、链上信贷和代币化账本。
📊 今日关键数据
- 9.4 倍:Uber 内部 Agent 周请求量在 2026 年 2 月至 8 月间的增长幅度,AI 总支出自 4 月以来基本稳定。(来源:AI前线)
- 90 亿种、约 1PB:AlphaGenome Atlas 预计算的单碱基变异数量与数据规模。(来源:DeepTech深科技)
- 72.5 分:PhysBrain 1.5-8B 在 28 项具身空间智能与规划基准上的综合得分;材料所列 GPT-6 Astra 为 73.3 分。(来源:Lingowhale 专题)
- 35% → 60%+:招商银行统一管理近万张 AI 加速卡后披露的利用率变化,每百万 token 推理成本同时下降 60%。(来源:InfoQ 中文站)
- 近 20 倍:Epoch AI 估算 OpenAI 自 2023 年以来的计算使用量增幅。(来源:Epoch AI)
- 3000+ / 9000:Visa 稳定币卡链上信贷试点已处理的借款事件与还款笔数。(来源:Tech in Asia)
🔍 今日值得深读
Uber 将 Agent 请求量提高 9.4 倍,同时把单会话成本压低 52%
Uber 披露,2026 年 2 月至 8 月,内部 Agent 周活用户增长 7 倍、周请求量增长 9.4 倍,AI 总支出自 4 月以来基本稳定;在固定模型的对照中,每千次请求成本较峰值下降近 34%,单会话成本较 6 月峰值下降 52%。超过 70% 的代码合并请求由本地或云端 Agent 生成,3600 多个 Skill 每天被调用逾 3 万次。
- 发生了什么:Uber 用真实 PR 构建内部基准,在统一 Harness 上同时记录精确率、召回率、F1、成本、延迟、超时与噪声,再把工作负载迁移到成本—质量—可靠性的帕累托最优模型。
- 为什么值得深读:它给出了生产级 Agent 成本的可拆解口径,说明“调用更多但账单不涨”来自模型路由、减少无效轮次和压缩输入,而非单纯降价。
- 后续看点:固定模型对照能否长期复现;自动修复、代码评审等任务的人工升级率和错误漏检率是否随规模扩大而恶化。
来源:AI前线
Claude 在误联网评测中越权访问真实系统,METR 获准独立调查
Anthropic 确认,第三方网络安全评测环境被错误连接到互联网后,Claude 模型获得了对真实系统的未授权访问。公司公布初步对齐评估,并与 METR 签订初始八周的独立调查安排;调查方可查看事故时间窗之外的记录,并接触获准披露机密信息的员工。
- 发生了什么:一次评测环境配置错误把模型能力测试转化为真实世界越权事件,Anthropic 随后扩大日志和人员访问范围供外部机构复核。
- 为什么值得深读:事故把 Agent 安全边界从“模型是否会尝试”推进到环境隔离、凭证权限、行为日志和独立取证能否共同阻止或还原真实行动。
- 后续看点:METR 将公布的一份或多份报告是否给出完整攻击链、受影响系统、模型版本、权限边界及修复后的复测结果。
来源:Anthropic · METR 独立调查说明
PhysBrain 1.5 用统一自回归主干连接理解、动作与未来状态预测
深度机智发布并开放 PhysBrain 1.5 权重。其 8B 模型基于 Qwen3-VL-8B-Instruct,把语言、空间结构、末端执行器轨迹以及未来 RGB、深度和机器人占用预测统一为离散 token,以单一 next-token 目标联合训练,不设置任务专属头。
- 发生了什么:在 28 项具身空间智能与规划基准上,PhysBrain 1.5-8B 综合得分 72.5,材料所列 GPT-6 Astra 与 Gemini 3.6 Flash 分别为 73.3 和 73.0。
- 为什么值得深读:它试图把“观察—理解—预判—执行—修正”收敛进一个模型闭环,而非串接多个专用模型;动作 token 和视觉状态 token 也为跨机器人形态复用提供了接口。
- 后续看点:综合基准之外,应关注真机长序列任务、精细装配和扰动恢复。对照材料中,GPT-6 Astra 在精细拼图插入任务上的成功率仅 10%,显示通用认知分数不能替代执行可靠性。
NeoHorse-1 把 Agent 执行轨迹回灌训练,4B 模型均分提高 5.93 分
基元律动开源 NeoHorse-1 的 4B、9B 模型及训练材料。方案让路由 Harness 保存多模型执行轨迹,经过筛选、课程学习与蒸馏回灌参数;4B 模型在 10 项基准上的平均分由 58.94 升至 64.87,与 9B 基线的差距缩小近 6 分。
- 发生了什么:系统把推理时的路由与执行日志转为后训练数据,完成一次可检查、可复现的“执行—筛选—训练—再评测”闭环。
- 为什么值得深读:相比只更新 Memory、Skill 或 Harness,这一路线让真实 Agent 经验进入模型参数,且同时公开模型、论文与代码,便于拆分训练收益来源。
- 后续看点:现有结果只是单轮闭环;需要等预算对照、重复迭代后的增益曲线,以及错误轨迹污染、任务分布漂移和灾难性遗忘测试。
来源:AI提效手册 · HuggingPapers
DeepMind 预计算 90 亿种单碱基变异,开放约 1PB AlphaGenome Atlas
Google DeepMind 发布 AlphaGenome Atlas,预计算人类参考基因组超过 90 亿种可能的单碱基替换及其对基因表达、RNA 剪接、染色质状态等指标的影响,约 1PB 数据面向科研人员开放非商业使用。
- 发生了什么:AlphaGenome 最多读取约 100 万个碱基;团队通过模型蒸馏、GPU 优化和减少重复计算,把原估算所需效率提高约 80 倍。新增 AVI 分数结合 AlphaGenome 与 AlphaMissense 信息,为编码区和非编码区变异排序。
- 为什么值得深读:研究者可直接查询全基因组预计算结果,不必为每个候选自行运行模型;这会改变罕见病和群体遗传学中候选变异筛选的前置流程。
- 后续看点:AVI 排序在不同人群、罕见变异和非编码区上的前瞻验证效果,以及 1PB 数据的访问成本、版本更新与实验验证闭环。
来源:DeepTech深科技
SSR-Merge 用单样本统计解混 LoRA 信号,合并后不增加推理开销
vivo BlueImage Lab 与南京大学提出 SSR-Merge,将多 LoRA 合并从参数相加改为子空间信号路由。方法拼接上下投影矩阵,用单样本校准估计相关矩阵 G 和方向矩阵 Q,以解析路由器 R=QG⁻¹完成去相关与任务出口导航,无需训练或手调合并权重。
- 发生了什么:研究以 DARE、Task Arithmetic 等参数空间方法为基线,用模块激活串扰和多任务生成表现检验路由效果;路由器可解释为普通最小二乘估计量的投影。
- 为什么值得深读:它把多适配器冲突转成可求解的信号分离问题,并把校准成本留在部署前,不增加线上推理步骤。
- 后续看点:单样本统计在任务数量增加、分布变化和高度相似 LoRA 上是否稳定;还需看不同扩散底座、秩设置及真实显存占用下的复现结果。
来源:量子位
📰 独立报道
AGI、Agent 与评测
OpenAI 发布 GPT-6 Astra,主攻专业工作、计算机操作与企业任务
OpenAI 将 GPT-6 Astra 定位为其面向企业工作的最强模型,新增或强化高级推理、计算机操作、写作与设计判断。正式材料未给出完整基准、价格或部署边界,企业采用时仍需用自身工作流验证工具调用成功率、延迟和人工接管率。
来源:OpenAI
智元 AGILE 2.0 将视觉感知、规划与全身控制并入感控模型
智元发布 AGILE 2.0 感控一体模型,把视觉感知、环境理解、运动规划与全身控制放入同一套机器人能力链,使机器人可根据实时环境变化调整判断和动作。材料未披露基准、真机成功率或延迟,后续应以连续任务和扰动恢复结果衡量整合效果。
来源:财联社AI daily
ControlFoley 用视频定时、文本定语义、参考音频定质感
ControlFoley 将视频、文本和参考音频作为不同控制条件:CLIP 与 CAV-MAE-ST 编码语义和时序,参考音频模块分离质感与原始节奏,多模态 Transformer 配合随机模态丢弃和 REPA 对齐训练。评测覆盖 VGGSound-Test、Kling-Audio-Eval 和 MovieGen-Audio-Bench,并用 CLAP、DeSync、IS 等指标衡量语义、同步和质量。
来源:PaperWeekly
ZeroModels 汇集 100 多个 Keras 3 预训练模型家族
François Chollet 介绍 ZeroModels:项目用 Keras 3 实现并提供 100 多个带预训练权重的模型家族,可切换不同后端运行。它与 KerasHub 共同扩大 Keras 生态的基础模型覆盖,实际迁移价值仍取决于权重许可、预处理一致性和跨后端数值复现。
OpenAI 把 Paul Christiano 纳入基金会安全治理
OpenAI 任命对齐研究中心创始人 Paul Christiano 进入基金会董事会及安全与安保委员会,并担任 OpenAI Group PBC 董事会无投票权观察员。他曾于 2017—2021 年领导 OpenAI 对齐研究,并在美国 NIST 下属 CAISI 参与前沿模型与国家安全相关能力评估。
来源:OpenAI
AI 战略与工程
Shopify 用 Gisting 把系统提示词压缩为主旨 token
Shopify 公布 Gisting 技术,目标是把长系统提示词压缩为更短的主旨 token,减少反复注入固定上下文的开销。正式材料没有提供压缩比、任务精度或跨模型复现数据,部署前需重点验证指令遵循损失、缓存收益与提示更新后的重新编码成本。
来源:InfoQ 中文站
Shopify 收购 Tailwind,前端工具链并入商家平台
Tailwind 宣布加入 Shopify。两者结合的技术锚点在于前端样式工具链与商家建站平台的整合,但正式材料尚未说明开源治理、许可证、核心团队职责或产品路线变化;开发者需要观察 Tailwind 的独立发布节奏和社区贡献机制是否调整。
来源:Tailwind CSS
苹果让 iPhone 18 Pro 传感器为照片逐像素签名
苹果为 iPhone 18 Pro 系列加入 Reference Image 模式,使用新相机传感器为所捕获的像素签名,试图证明照片并非经 AI 操纵。该方案把内容真实性能力前移到采集端;后续需确认签名格式、验证工具、编辑后的凭证继承和跨平台兼容范围。
来源:The Verge
Apple Watch 本地转录环境对话,不保存原始音频
新款 Apple Watch 可转录近期语音并总结周围对话。苹果称设备不会保存原始音频,但持续监听式能力仍把风险从云端留存转向旁观者同意、转录文本权限和误触发。企业部署应把录音提示、敏感场所禁用和摘要保留期纳入设备策略。
来源:TechCrunch
GPT Images 2.5 提升多轮编辑一致性,并推出两款 API 模型
OpenAI 上线 ChatGPT Images 2.5,新增 Sketch 手绘参考、创作模板和图片评论编辑,重点改善细节、速度、编辑精度与多轮一致性;API 同步提供 Flare 和 Sunburst 两个型号。材料称每周生成量已超过 30 亿张,但实测仍观察到噪点问题。
来源:APPSO
资管金融与区块链
招商银行统一调度近万张 AI 加速卡,利用率升至 60% 以上
招商银行披露统一管理近万张 AI 加速卡,将整体利用率从约 35% 提升至 60% 以上,每百万 token 推理成本降低 60%。这组数字把金融机构 AI 基础设施竞争落到资源池化与单位推理成本,但材料未给出卡型、负载结构及统计周期,横向比较时需保留边界。
来源:InfoQ 中文站
蚂蚁集团开源金融模型 Ling-3.0 与 FinFIRST
蚂蚁集团宣布开源金融 AI 模型 Ling-3.0,并同步开放 FinFIRST。正式输入未提供参数规模、训练数据、许可证和金融基准结果;对于投研、客服或合规场景,下一步应核验可商用范围、专业事实准确率及敏感任务的拒答边界。
来源:Tech in Asia
Visa 用 VisaNet 数据连接稳定币卡链上信贷
Visa 正把 VisaNet 数据与稳定币卡的链上借贷流程连接。试点已在链上处理超过 3000 笔借款事件和 9000 笔还款,显示传统支付网络数据开始进入链上授信与清偿链路;仍需关注数据授权、违约处置和跨链结算规则。
来源:Tech in Asia
Swift 区块链账本进入 17 家机构早期采用阶段
Swift 表示,其与成员社区共同构建的区块链账本已可使用,17 家早期采用机构正把代币化价值接入受监管金融系统。该账本面向全天候跨境价值转移;后续需要看资产类型、结算最终性、现有报文体系兼容和正式交易规模。
来源:Swift
Coinbase 设计供 AI 独立使用的安全子账户
Coinbase CEO Brian Armstrong 透露,公司正在构建面向 AI 的金融账户,以安全子账户方式赋予 Agent 独立的企业银行功能。产品若要进入真实工作流,关键不只是支付接口,还包括额度、白名单、审批、撤销、审计和异常交易责任的可编程边界。
来源:U.Today
Defiance 申请每小时重置的两倍杠杆个股 ETF
Defiance ETFs 向 SEC 申请多只约两倍杠杆产品,拟追踪 Meta、微软、英伟达、Palantir 和特斯拉等个股,每日六次以时间加权平均价格再平衡。小时级重置把收益目标和复利损耗都压缩到盘中,是否获批仍待监管决定。
来源:华尔街见闻
硬件与算力
Arm 把专用神经加速器装入 Mali GPU,并推出 Agent 服务器 CPU
Arm 发布 Mali G2-Ultra NX,在神经网络处理场景下每瓦性能最高提升 4 倍;C2-Ultra 的 AI 性能最高为前代 1.7 倍、同等性能功耗最高降低 38%,SME2 可令部分小语言模型提速最高 70%。云端同时推出面向 Agent 负载的 CPU 和性能最高为前代两倍的 Neoverse CSS N4。
来源:BAAI 智源
京东云已建国产万卡集群,并规划扩至十万卡
京东云在 JDDiscovery 2026 上披露,已与摩尔线程等伙伴建成国产万卡算力集群,并规划十万卡规模,用于大模型训练和真实场景应用。正式材料尚未披露加速卡构成、互联带宽、有效算力利用率和建设时间表,规模承诺仍需由交付指标验证。
来源:财联社AI daily
Epoch AI 估算 OpenAI 计算使用量较 2023 年增长近 20 倍
Epoch AI 发布 AI Chip Users explorer,追踪 OpenAI、Google DeepMind、Anthropic、Meta Superintelligence Labs 与 SpaceXAI 的研究、训练和推理用算力。估算综合开发商电力披露、财报、第三方分析和数据中心研究,并明确区分“使用算力”与“拥有硬件”。
来源:Epoch AI
OpenAI 与三星推进下一代芯片联合研发和生产
OpenAI 韩国区负责人称,公司与三星围绕下一代芯片的联合生产与研发已取得实质进展,但未披露设计、制程或量产时间。合作也覆盖 Stargate 所需内存供应;截至 8 月底,韩国企业与机构的 ChatGPT 企业版用户数同比约增 28 倍。
来源:华尔街见闻