前沿科技日报 · 2026-07-31
Google DeepMind 把 Gemini Robotics 2 接入人形机器人全身控制与多机器人协作;OpenAI 证明运行栈设置可让 GPT-5.6 Sol 的 ARC-AGI-3 得分提高 188%;模型与代码安全开始同时核算数据忠实度、法律责任和维护成本。
2026-07-31 前沿科技洞见 · 日报
📊 今日关键数据
- 188% / 六分之一:启用保留推理与上下文压缩后,GPT-5.6 Sol 在 ARC-AGI-3 公开集的得分提高 188%,输出 Token 减至原来的六分之一(来源:OpenAI)
- 51.5% / 37.5%:PDD 跨集群推理测试中,首 Token 延迟降低 51.5%,单 Token 成本降低 37.5%(来源:PaperWeekly)
- 99.3% / 71.0%–73.9%:SECFID 测试中,部分强防御模型达到 99.3% 安全率,但数据忠实度降至 71.0%–73.9%(来源:量子位)
- 40.1% / 0.23 美元:Inkling Small 的 ARC-AGI-2 得分为 40.1%,单任务成本 0.23 美元(来源:ARC Prize)
- 36.5% → 67.1%:Echoverse 的 12 个高保真训练世界把 9B 电脑 Agent 任务得分从 36.5% 提高到 67.1%(来源:BAAI 智源)
- 43% / 近 3000%:调查显示 43% 的财富顾问使用 AI 会议工具;Global Relay 记录的 ChatGPT 通信捕获量同比增长近 3000%(来源:Business & Money_Licensing)
🔍 今日值得深读
Gemini Robotics 2 同时控制全身、灵巧手与多台机器人
Google DeepMind 发布 Gemini Robotics 2,把同一套通用机器人模型用于人形机器人的全身动作、精细操作和多机器人协作。演示中,每台机器人独立运行模型,通过推理判断任务步骤、完成状态和交接时机;这比单机执行预设动作多了一层任务编排。
- 关键变化:模型需要协调人形机器人全身的高自由度动作,也要驱动包含 22 个关节的手完成精细操作。
- 为什么值得深读:通用具身模型要同时解决动作规划、身体状态感知、精度控制和机器人之间的任务交接,任一环节失效都会中断真实任务。
- 后续看点:同一模型能否在更多机器人形态和非演示环境中保持全身控制精度与协作稳定性。
来源:Google DeepMind · WIRED
两项 API 设置让 GPT-5.6 Sol 的 ARC-AGI-3 得分提高 188%
OpenAI 发现,ARC-AGI-3 的标准运行栈会在每一步后丢弃推理,并在上下文变长时移除早期动作,导致模型反复重新学习。启用保留推理和上下文压缩后,GPT-5.6 Sol 在公开集上的得分提高 188%,输出 Token 反而减少至原来的六分之一。
- 关键变化:实验只调整 Responses API 的运行设置,没有更换模型权重。
- 为什么值得深读:长程 Agent 的评测结果同时受模型、上下文保存方式和运行栈影响,单看模型名称无法解释实际表现。
- 后续看点:同样的设置能否在其他长程交互基准和生产任务中复现性能与 Token 消耗的同步改善。
来源:OpenAI
PDD 用中继解码把跨城推理首 Token 延迟降低 51.5%
无问芯穹公布跨集群异构推理架构 PDD,把预填充、短时中继解码和主解码拆到三级链路。系统以中继实例覆盖 KV Cache 跨城传输等待,并利用高前缀缓存命中率减少传输量;测试中首 Token 延迟降低 51.5%,单 Token 成本降低 37.5%。
- 关键变化:PDD 用广域以太网连接多地存量集群,并让不同硬件分别承担更适合的预填充或解码工作。
- 为什么值得深读:跨集群推理的主要约束不只在带宽,还在少量低缓存命中请求造成的长尾传输延迟。
- 后续看点:该架构在缓存命中率下降、输出变长或广域网抖动时,能否维持延迟和成本优势。
来源:PaperWeekly
SECFID 发现强提示词注入防御会误删近三成有效数据
UIUC 与亚马逊团队用 SECFID 测试 48 种模型与防御配置,把“执行恶意指令”“把指令文本当数据处理”和“直接忽略文本”分开计量。部分强防御配置把安全率推到 99.3%,但数据忠实度降至 71.0%–73.9%,说明原有指标会把误删业务内容也算成防御成功。
- 关键变化:SECFID 包含 1168 个文本用例和 252 个 Agent 工具调用场景,同时评估安全率与忠实度。
- 为什么值得深读:翻译、编辑、抽取等任务必须保留输入中的指令式文本,过度过滤会在没有被劫持的情况下损坏业务结果。
- 后续看点:感知偏好微调能否在更多模型和真实 RAG、邮件、文档流程中同时保持安全与数据完整。
来源:量子位
GCC 拒收具有法律重要性的 AI 生成代码
GCC 指导委员会认可新的 AI 使用政策:拒绝包含或衍生自大模型生成内容、且具有法律重要性的代码贡献;非核心贡献可在明确标注 AI 使用后由维护者决定是否接受,测试用例另设例外。
- 关键变化:政策把版权、许可证和责任归属与普通代码质量问题分开处理。
- 为什么值得深读:生成代码降低了提交成本,却可能把解释设计、回应审查和承担责任的成本转移给维护者。
- 后续看点:GCC 将如何界定“具有法律重要性”,以及贡献标注和测试用例例外如何执行。
来源:CSDN
财富顾问的 AI 会议记录被纳入自动归档和审计
Mili 与 Global Relay 打通接口,Mili 生成的顾问会议记录将自动进入金融机构现有档案,并保留完整审计轨迹。两家公司把生成式 AI 摘要按电子邮件、消息和语音通信的同类义务处理,直接回应 SEC Rule 17a-4 与 FINRA Rule 4511 的留存要求。
- 关键变化:AI 记录从顾问的个人生产工具进入机构级通信捕获、监督和审计流程。
- 为什么值得深读:财富管理采用 AI 的瓶颈已落到记录能否完整捕获、长期保存并供合规团队复核。
- 后续看点:经纪交易商和注册投资顾问如何把会议摘要的生成、修改、审批与最终归档串成可审计链路。
🔥 今日聚合动态
Inkling Small 用 12B 激活参数逼近旗舰模型
Thinking Machines 发布开放权重推理模型 Inkling Small。ARC Prize 给出可复核的 ARC-AGI 成绩与单任务成本,Artificial Analysis 则补充参数规模、上下文、模态和能力短板;两组结果共同说明,小模型在推理与编码任务上逼近旗舰版本,但 Agent 任务和知识准确性仍有明显损失。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| ARC-AGI | ARC Prize | ARC-AGI-2 得分 40.1%、成本 0.23 美元/任务;ARC-AGI-1 得分 84%、成本 0.11 美元/任务。 |
| 综合评测 | Artificial Analysis | 模型共 276B 参数、每 Token 激活 12B,智能指数得分 40;在 τ³-Banking 上以 15% 落后旗舰模型的 24%。 |
- 互补信息:ARC Prize 验证抽象推理成本,Artificial Analysis 揭示参数效率、模态能力以及银行 Agent 和知识准确性上的代价。
- 后续看点:未来数周公布的 ARC-AGI-3 结果,能否保持当前开放权重模型的成本与能力优势。
📰 独立报道
🤖 AGI 前沿
HumanCLAW 把具身决策与电机控制拆开评测
Meta 等机构提出 HumanCLAW,在 1218 个具身任务片段中单独考察视觉语言模型的动作决策。没有模型完成该基准,最高成功率仅 16.8%;主要失败是模型无法持续记住自己控制的身体状态。
Echoverse 用高保真模拟把 9B 电脑 Agent 得分从 36.5% 提至 67.1%
Echoverse 构建 12 个可持续演化的训练世界,复现真实应用行为、数据与跨界面状态。联合训练后,9B 模型任务得分由 36.5% 升至 67.1%;浅层模拟反而造成性能下降,说明模拟质量比单纯增加样本更关键。
来源:BAAI 智源
SemVID 在极低 Token 预算下保留视频事件边界
ECCV 2026 论文 SemVID 在推理阶段把视觉 Token 分成对象、动作和场景三类,保留跨帧证据链,无需重训骨干模型。它在 Charades-STA 与 ActivityNet-Grounding 上以更少 Token 维持较高时序定位精度,但镜头移动和遮挡仍会干扰动作 Token。
来源:量子位
Sonar-TS 让自然语言查询覆盖百万级时序数据
ICML 2026 论文 Sonar-TS 先用 SAX 符号索引粗搜,再由大模型生成代码验证候选区间。数据库规模测试总分 0.6144,是最强 Text-to-SQL 基线的约 3.8 倍;形态理解较难的任务仍是短板。
来源:PaperWeekly
DecoEvo 让求解器与评分标准共同演化
DecoEvo 把求解器和评分规则生成器分开计分并在文本空间共同演化。研究在三个大模型骨干、五项基准上取得 2.8%–5.0% 的相对提升,把“改答案”和“改判断标准”纳入同一训练循环。
TurboVLA 把视觉语言动作模型压到 0.9GB 显存
TurboVLA 在 RTX 4090 上以 0.9GB 推理显存达到 32Hz。这组结果把 VLA 模型的实时控制与低显存部署放到同一指标下,但正式材料未披露任务集、成功率或跨机器人泛化结果。
OpenAI 下调 Luna 与 Terra API 价格
OpenAI 将 GPT-5.6 Luna 价格下调 80%,新价为每百万输入 Token 0.20 美元、输出 Token 1.20 美元;Terra 降价 20%,输入与输出价格分别为 2 美元和 12 美元。Sol 订阅与配额不变,API 新增快速模式。
来源:华尔街见闻
FAR.AI 安全榜显示前沿模型的越狱防护差距悬殊
FAR.AI 联合创始人 Adam Gleave 介绍首个针对开发商实际部署防护的横向评测。Claude Fable 5 与 GPT-5.6 Sol 扛住测试套件,Grok 4.5 与 Gemini 3.1 Pro 则被低成本方法找出数百个通用越狱,很多攻击更接近社会工程而非复杂机器学习。
Cognition 用可合并性评估编程 Agent 的真实产出
Cognition 总裁 Russell Kaplan 介绍 Devin 的模型路由与生产评估:更聪明的路由让性价比提高 35%,团队把代码能否合并作为新评测门槛,并用会话是否产出有效工作衡量 Agent,而非只统计 Token 或任务完成声明。
来源:LangChain
🏢 AI 战略与组织变革
WorkBuddy 把 Agent 编辑接入多人共享的腾讯文档
WorkBuddy 新版本允许用户在侧边栏直接编辑 Word、PPT、Excel 和 Markdown,并把文件同步到腾讯文档。同一在线文档可由多人及各自的 Agent 共同读取和修改,共享权限、批注与任务状态成为协作底座。
来源:人人都是产品经理
字节将飞书产品并入豆包,To B 商业化并入火山引擎
字节跳动把飞书产品团队与豆包整合,由赵祺负责;飞书市场、销售和客户团队与火山引擎合并为“创造力服务平台”,由谭待统一管理。产品、企业知识与权限、云和模型部署由此进入同一组织链路。
来源:AI组织进化论
Meta 用 FBTriton 承接实验性 GPU 优化
Meta 公开 FBTriton 的工程定位:它承载 TLX、torchTLX、autoWS 等实验性 GPU 优化,并让英伟达、AMD 与学术伙伴共同测试编译器和 DSL 改动。项目以 L1/L2/L3 分层验证连接实验代码与生产上游。
来源:PyTorch
💰 资管与金融科技前沿
英国首只全原生受监管代币化基金在 Solana 发行
管理 1970 亿英镑资产的 Baillie Gifford 使用 BNY 新数字过户代理,为英国首只“全原生”受监管代币化基金提供登记基础设施;该基金 BAGEY 在 Solana 上发行。
来源:Solana
Partior 与 OpenAssets 完成代币化存款原子结算验证
Partior 与 OpenAssets 完成概念验证,让数字资产、受监管稳定币和商业银行代币化存款同步交付与支付。流程覆盖资产移动、自动账本对账和最终入账,并支持逐笔或批量实时结算。
Casap 用 Agent 自动处理八成支付争议
Casap 把支付争议的材料收集、申诉和处理流程交给 Agentic AI,披露可自动处理 80% 的案件,退款申诉胜诉率达到 97%。这把银行的争议自动化从辅助分类推进到完整案件生命周期。
来源:马克解读金融科技
🔐 安全与基础设施
俄方黑客利用 Exchange 最高危漏洞植入 OWAReaper
Proofpoint 称 TA488 正利用 Microsoft Exchange Server 最高危漏洞攻击未修补网络。用户只需在 Outlook Web Access 打开邮件就可能触发感染,攻击链最终植入用于长期访问的浏览器端 JavaScript 后门 OWAReaper。
来源:Ars Technica
AI 辅助漏洞发现推动 Chrome 每周修补两次
Google 因 AI 辅助漏洞发现加快 Chrome 更新。6 月两次更新修复的漏洞数量超过此前 23 次更新总和,浏览器补丁节奏提高到每周两次,安全团队需要适应更密集的发布与回归测试。
来源:WIRED
🎓 学术前沿
IBM 列出三项可验证的量子优势结果
IBM 在量子优势追踪器中新增三项结果,分别用不同方法处理误差并验证量子计算输出。重点不只是量子硬件快于经典计算,还要在经典模拟无法覆盖的任务上证明结果可信,避免把噪声或尚未发现的经典算法误当优势。
来源:Ars Technica
🔧 硬件算力与智能设备
Zoox 获准在拉斯维加斯运营无方向盘付费 Robotaxi
Amazon 旗下 Zoox 获得美国联邦安全标准的临时豁免,可在拉斯维加斯启动真实付费服务。车辆没有方向盘,这次许可把其无人工驾驶舱设计从免费试乘推进到商业运营。
来源:WIRED