FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-09-04

前沿模型竞争从单次能力分数转向长程执行可靠性,世界模型与推理系统同步补齐“持续工作”能力

降低FOMO的每日信息交付

2026-09-04 前沿科技洞见 · 日报

过去 24 小时的新增信息集中在三个层面:GPT-6 Astra 把电脑操作、长程工程任务与网络安全能力推到新的部署门槛;Agent 研究开始直接评测运行支架、跨年度经营和重复执行稳定性,而非只看单次答案;世界模型、机器人和推理基础设施则围绕长时状态、失败恢复与实时交互继续收敛。

📊 今日关键数据

🔍 今日值得深读

GPT-6 Astra 上线,ARC-AGI-3 标准支架得分 63%,安全能力首次达到 Critical

OpenAI 向 Daybreak 客户首批开放 GPT-6 Astra,并将其定位为电脑操作与编码模型。ARC Prize 用标准支架测得 ARC-AGI-3 得分 63%;换用保留不透明推理并做上下文压缩的 provider adapter 后得分升至 99%,说明支架设计本身显著影响长程评测。官方同时披露,Astra 是其首个按 Preparedness Framework 达到网络安全 Critical 级别的广泛部署模型。

来源:OpenAI 发布报道 · ARC Prize 评测 · OpenAI 安全说明 · 训练规模 · 定价

E-Commerce Bench 让 Agent 用 10 万元经营网店 365 天,几乎没有模型学会持续改进

阿里千问发布长程自主经营评测 E-Commerce Bench。Agent 以 10 万元初始资金运营网店一年,连续处理采购、谈判、定价、促销、库存、退货与现金流,市场由真实电商数据驱动。

来源:阿里千问

Facet-0 在五项计算机装配任务平均成功率 82%,失败恢复率升至 81%

南洋理工大学 PINE Lab 发布面向接触丰富型精密操作的机器人基础模型 Facet-0,在 RAM、CPU、硬盘和 GPU 等真实装配任务中联合使用视觉、语言、本体状态与六维力觉。

来源:机器之心

EASE 用 12.7 万条证据框监督视觉注意力,三种 VLM 平均提升 2.5—3.1 个百分点

哈工大、中关村学院等团队提出 EASE,把证据区域转换为视觉 token 的平滑目标分布,在多模态 RLVR 训练时监督回答 token 应关注的位置,推理阶段无需额外标注或计算分支。

来源:机器之心

STATE 用逾 2.67 亿单细胞数据训练,跨细胞扰动预测较基线提升超过 30%

Arc Institute 团队在《Cell》发表虚拟细胞模型 STATE,并推出 Cell-Eval 标准化评测套件,目标是根据细胞当前状态和药物或基因干预预测后续状态,尤其处理未见细胞环境的泛化。

来源:DeepTech 深科技

vLLM 针对真实 Agent 流量改造 KV 缓存,两周把 Kimi 高并发吞吐提高逾 6 倍

vLLM 团队针对 Agent 每轮重复读取长历史的问题,改造离卡 KV 缓存的保存与复用:共享前缀只保存一次,每轮只追加新增状态;跨机器拆分预填充与解码时,还可移交混合模型的完整状态。

来源:SemiAnalysis:增量共享缓存 · SemiAnalysis:吞吐结果

K2 Horizon 发布 0.9B 至 375B 六档模型,并开放训练代码、数据配方、检查点和日志

Institute of Foundation Models 发布 K2 Horizon 模型族,覆盖 0.9B、3.7B、7B 到 375B 等六个规模,同时交付权重之外的训练代码、数据配方、检查点、日志与评测记录。

来源:K2 Horizon 发布信息

🔥 今日聚合动态

世界模型从短视频生成转向可交互、长时持续和真实机器人迁移

四项更新分别补齐世界模型的控制、持续时间、开放数据和机器人迁移:Runway 让 Worlds 2 按输入持续生成影音世界;SolarWM 用短片训练后实现分钟至小时级 rollout;ZimaBlue 扩大视频预训练后提高真实机器人零样本成功率;World Labs Atlas 则从多模态输入重建可控 3D 视图。它们使用的任务和指标不同,不能直接横比,但共同把重点从“生成一段视频”移向“维持可行动的状态”。

视角来源核心信息
实时交互RunwayWorlds 2 连续生成 720p、24 fps 视频和 48 kHz 音频,文本动作与相机运动可持续注入,无预设时长
开放长时训练HuggingPapersSolarWM 汇集 14 个数据集的 143 万片段和 4 种骨干,训练片段仅 5 秒,rollout 可持续分钟至小时
机器人迁移HuggingPapersZimaBlue 将视频预训练扩至 12 万小时,真实机器人零样本成功率由 36.1% 升至 77.8%,动作预测 30 Hz
多视图重建InfoQAtlas 从多模态输入和相机移动生成图像、视频帧与 3D 视图

📰 独立报道

AGI、Agent 与评测

Google 开源 Teamwork,用“生成—压力测试—组合”循环组织多智能体研究

Teamwork 将协作模式与 Agent 本身分离,按任务动态调整团队规模,并为不可拆任务、并行工程、开放数学、逐步验证和论文审查提供不同模式。长证明流程会给候选路线配置反驳者,保留失败路线中的可用部分,再综合进入下一轮。

来源:Datawhale

HarnessDev 评测模型能否自己开发 Agent 支架,自动产物仍落后于人工实现

字节跳动 Seed 提出 HarnessDev,把评测对象从任务最终输出转为可运行的 Agent 基础设施。研究覆盖 6 个“创建者”模型和 5 个基准;自动生成的支架在代码与搜索任务上仍落后于人工工程支架,后续自我演化带来的改进也不稳定。

来源:HuggingPapers

Martian 用每个数据点重复运行 10 次衡量模型可靠性,揭示平均分掩盖的波动

AI Frontier 在 16 个常用基准上对每个数据点运行 10 次,把“同一提示下是否稳定答对或答错”与原始准确率分开。当前可靠性表中 Qwen3.7 Max 为 96.1%、Claude Opus 4.6 为 94.4%、GPT-5.5 为 93.5%;论文称同成本 oracle 路由可减少 54% 错误,但这是上界而非可直接部署的路由器。

来源:AI Frontier 评测介绍

苹果 IVT 把未来帧预测留在训练阶段,主动视频推理延迟降低逾 5 倍

IVT 在后训练时同时预测文本答案与未来视频帧的隐空间表示,推理时移除未来预测分支。Visual CoT 在两类任务中延迟约 6.55 秒,而 Answer-Only SFT 为 1.07—1.32 秒;IVT 在 6 项任务均超过 Answer-Only SFT,避免显式生成未来画面的误差和开销。

来源:AI 提效手册

Gemini 3.8 Flash Cyber 在 CWE-Bench 达到 47.2% pass@1

Google 发布 Gemini 3.8 Flash 与受限开放的 Flash Cyber。后者面向漏洞发现和自动修补,在外部 CWE-Bench 的 pass@1 为 47.2%;Google 另称其在覆盖 20 种语言的内部测试中成功率超过 70%,因网络安全限制更宽松,目前仅向受信任机构开放。

来源:Tech in Asia

Richard Sutton 把持续学习指向部署后的数据闭环与新架构

图灵奖得主 Richard Sutton 在 HICOOL 圆桌中强调,当前模型训练完成后权重基本固定,并非“一生中学习”。与会研究者把物理 AI 的技术缺口具体化为世界模型系统、部署数据回流、适配持续学习的新架构,以及尚未建立的持续学习基准。

来源:智源社区

OpenAI 确认自研人形与特种机器人,短期先服务数据中心

OpenAI CEO Sam Altman 首次明确公司将研发人形及其他形态机器人,短期重点不是家庭陪伴,而是协助熟练工人建设和运营数据中心。现有招聘已覆盖软件、电气、固件、控制、传感器、数据采集、故障处理和量产准备,显示其目标包括本体而非仅提供模型。

来源:虎嗅

AI 战略与工程

四家前沿模型服务同日出现重叠故障,长程 Agent 暴露供应商集中风险

OpenAI、Anthropic、xAI 与 Google 的云端模型服务在数小时内出现罕见重叠中断。Anthropic 报告多款 Claude 模型请求错误升高,OpenAI 则报告 ChatGPT 与 Codex 性能降级;对依赖持续调用的 Agent 工作流,跨模型降级和状态恢复需要从可选设计变成运行保障。

来源:Ars Technica

Humain 基于 MiniMax 开放模型开发阿拉伯语国家级 AI 平台

沙特 AI 公司 Humain 发布 humain-m3,底层采用 MiniMax 的开放模型,面向阿拉伯语场景建设国家级平台。该路线显示“主权 AI”不一定从基础模型零开始,也可能通过开放权重、本地数据与本地部署组合完成,但模型依赖来源同时进入国家级技术治理议题。

来源:Techmeme / Bloomberg 摘要

资管金融与区块链

Open Reserve 获美国全国性银行牌照有条件批准,核心系统按 24/7 链上结算设计

美国货币监理署对 Open Reserve 的全服务全国性银行牌照申请给予有条件批准。创始团队称将围绕全天候结算、稳定币、代币化存款和链上资本市场重建银行核心,并把核心账本类比为 L1;下一步关键是牌照条件落实及存贷款与链上结算的隔离设计。

来源:a16z crypto

Bottomline 用 Chainlink 把 ISO 20022 工作流接入公私链

Swift 服务商 Bottomline 与 Chainlink 合作,为 600 多家银行提供跨链、跨境支付入口。方案以 CCIP 连接公链与私链、CRE 编排端到端流程,银行可继续使用 ISO 20022 消息并通过单一网络无关连接访问链上通道;Bottomline 平台每年处理支付超过 16 万亿美元。

来源:Chainlink

Solana Payment Channels 把 Agent 高频 API 计费移到通道内,宣称每秒 100 万笔

Solana 上线 Payment Channels,针对 Agent 循环调用 API 时每次签名和结算的摩擦,将高频小额支付放进通道处理。首批场景包括阿里云 API 端点,官方宣称通道可达每秒 100 万笔支付;仍需独立披露测试拓扑、结算最终性与争议处理条件。

来源:Solana

SeoulLabs Pay 用 DID/VC 将代理身份、委托范围与付款凭证绑定

SeoulLabs 正开发 Agent 支付控制层:将通过 KYC 的委托人与兼容 W3C DID/VC 的代理凭证关联,把商户、资产、限额、有效期和人工审批触发器写入可撤销授权;确定性策略引擎在付款前校验,个人原始数据留在链下,审计证据可跨卡、转账、稳定币和链上结算保持一致。

来源:EIN Presswire

硬件与算力

Cerebras CS-4 用三颗 WSE-3 Turbo 提供 250 PFLOPS 单晶圆算力

Cerebras 发布 CS-4 机架级系统,单机搭载三颗 WSE-3 Turbo;每片晶圆集成 4 万亿晶体管、90 万个 AI 核心,算力 250 PFLOPS、内存带宽 43.2 PB/s。公司宣称相对生产 GPU 系统推理最高快 30 倍、每瓦吞吐较 CS-3 提高 10 倍,并支持超千 token/s。

来源:Cerebras 视频

高通把 Matrix Cores 与 18MB 专用缓存加入 Adreno 图形管线

Adreno Neural Fusion 将神经处理、AI 超分和帧生成整合进移动 GPU 图形管线。专用 Matrix Cores 配合 18MB Adreno 高性能内存,减少模型在不同处理单元间搬运;高通称能效提高约 12%,并已获 Unity 与 Unreal Engine 支持。

来源:智东西

台积电设备需求八个月升至基准的 1.9 倍,全球约 20 座晶圆厂同步建设

台积电高管称设备需求从去年底基准升至今年 7 月的 1.9 倍,即便中国台湾地区有 13 座、全球其他地区另有五至六座晶圆厂在建,仍不足以满足需求。压力已从先进制程传向先进封装、ABF 基板、TGV 材料与日本上游设备供应商。

来源:华尔街见闻

图文卡片 ⬇️ 一键下载图文卡片