🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-07-31

Google DeepMind 把 Gemini Robotics 2 接入人形机器人全身控制与多机器人协作;OpenAI 证明运行栈设置可让 GPT-5.6 Sol 的 ARC-AGI-3 得分提高 188%;模型与代码安全开始同时核算数据忠实度、法律责任和维护成本。

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-07-31 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

Gemini Robotics 2 同时控制全身、灵巧手与多台机器人

Google DeepMind 发布 Gemini Robotics 2,把同一套通用机器人模型用于人形机器人的全身动作、精细操作和多机器人协作。演示中,每台机器人独立运行模型,通过推理判断任务步骤、完成状态和交接时机;这比单机执行预设动作多了一层任务编排。

来源:Google DeepMind · WIRED

两项 API 设置让 GPT-5.6 Sol 的 ARC-AGI-3 得分提高 188%

OpenAI 发现,ARC-AGI-3 的标准运行栈会在每一步后丢弃推理,并在上下文变长时移除早期动作,导致模型反复重新学习。启用保留推理和上下文压缩后,GPT-5.6 Sol 在公开集上的得分提高 188%,输出 Token 反而减少至原来的六分之一。

来源:OpenAI

PDD 用中继解码把跨城推理首 Token 延迟降低 51.5%

无问芯穹公布跨集群异构推理架构 PDD,把预填充、短时中继解码和主解码拆到三级链路。系统以中继实例覆盖 KV Cache 跨城传输等待,并利用高前缀缓存命中率减少传输量;测试中首 Token 延迟降低 51.5%,单 Token 成本降低 37.5%。

来源:PaperWeekly

SECFID 发现强提示词注入防御会误删近三成有效数据

UIUC 与亚马逊团队用 SECFID 测试 48 种模型与防御配置,把“执行恶意指令”“把指令文本当数据处理”和“直接忽略文本”分开计量。部分强防御配置把安全率推到 99.3%,但数据忠实度降至 71.0%–73.9%,说明原有指标会把误删业务内容也算成防御成功。

来源:量子位

GCC 拒收具有法律重要性的 AI 生成代码

GCC 指导委员会认可新的 AI 使用政策:拒绝包含或衍生自大模型生成内容、且具有法律重要性的代码贡献;非核心贡献可在明确标注 AI 使用后由维护者决定是否接受,测试用例另设例外。

来源:CSDN

财富顾问的 AI 会议记录被纳入自动归档和审计

Mili 与 Global Relay 打通接口,Mili 生成的顾问会议记录将自动进入金融机构现有档案,并保留完整审计轨迹。两家公司把生成式 AI 摘要按电子邮件、消息和语音通信的同类义务处理,直接回应 SEC Rule 17a-4 与 FINRA Rule 4511 的留存要求。

来源:Business & Money_Licensing


🔥 今日聚合动态

Inkling Small 用 12B 激活参数逼近旗舰模型

Thinking Machines 发布开放权重推理模型 Inkling Small。ARC Prize 给出可复核的 ARC-AGI 成绩与单任务成本,Artificial Analysis 则补充参数规模、上下文、模态和能力短板;两组结果共同说明,小模型在推理与编码任务上逼近旗舰版本,但 Agent 任务和知识准确性仍有明显损失。

视角来源核心信息
ARC-AGIARC PrizeARC-AGI-2 得分 40.1%、成本 0.23 美元/任务;ARC-AGI-1 得分 84%、成本 0.11 美元/任务。
综合评测Artificial Analysis模型共 276B 参数、每 Token 激活 12B,智能指数得分 40;在 τ³-Banking 上以 15% 落后旗舰模型的 24%。

📰 独立报道

🤖 AGI 前沿

HumanCLAW 把具身决策与电机控制拆开评测

Meta 等机构提出 HumanCLAW,在 1218 个具身任务片段中单独考察视觉语言模型的动作决策。没有模型完成该基准,最高成功率仅 16.8%;主要失败是模型无法持续记住自己控制的身体状态。

来源:HuggingPapers

Echoverse 用高保真模拟把 9B 电脑 Agent 得分从 36.5% 提至 67.1%

Echoverse 构建 12 个可持续演化的训练世界,复现真实应用行为、数据与跨界面状态。联合训练后,9B 模型任务得分由 36.5% 升至 67.1%;浅层模拟反而造成性能下降,说明模拟质量比单纯增加样本更关键。

来源:BAAI 智源

SemVID 在极低 Token 预算下保留视频事件边界

ECCV 2026 论文 SemVID 在推理阶段把视觉 Token 分成对象、动作和场景三类,保留跨帧证据链,无需重训骨干模型。它在 Charades-STA 与 ActivityNet-Grounding 上以更少 Token 维持较高时序定位精度,但镜头移动和遮挡仍会干扰动作 Token。

来源:量子位

Sonar-TS 让自然语言查询覆盖百万级时序数据

ICML 2026 论文 Sonar-TS 先用 SAX 符号索引粗搜,再由大模型生成代码验证候选区间。数据库规模测试总分 0.6144,是最强 Text-to-SQL 基线的约 3.8 倍;形态理解较难的任务仍是短板。

来源:PaperWeekly

DecoEvo 让求解器与评分标准共同演化

DecoEvo 把求解器和评分规则生成器分开计分并在文本空间共同演化。研究在三个大模型骨干、五项基准上取得 2.8%–5.0% 的相对提升,把“改答案”和“改判断标准”纳入同一训练循环。

来源:HuggingPapers

TurboVLA 把视觉语言动作模型压到 0.9GB 显存

TurboVLA 在 RTX 4090 上以 0.9GB 推理显存达到 32Hz。这组结果把 VLA 模型的实时控制与低显存部署放到同一指标下,但正式材料未披露任务集、成功率或跨机器人泛化结果。

来源:HuggingPapers

OpenAI 下调 Luna 与 Terra API 价格

OpenAI 将 GPT-5.6 Luna 价格下调 80%,新价为每百万输入 Token 0.20 美元、输出 Token 1.20 美元;Terra 降价 20%,输入与输出价格分别为 2 美元和 12 美元。Sol 订阅与配额不变,API 新增快速模式。

来源:华尔街见闻

FAR.AI 安全榜显示前沿模型的越狱防护差距悬殊

FAR.AI 联合创始人 Adam Gleave 介绍首个针对开发商实际部署防护的横向评测。Claude Fable 5 与 GPT-5.6 Sol 扛住测试套件,Grok 4.5 与 Gemini 3.1 Pro 则被低成本方法找出数百个通用越狱,很多攻击更接近社会工程而非复杂机器学习。

来源:The Cognitive Revolution

Cognition 用可合并性评估编程 Agent 的真实产出

Cognition 总裁 Russell Kaplan 介绍 Devin 的模型路由与生产评估:更聪明的路由让性价比提高 35%,团队把代码能否合并作为新评测门槛,并用会话是否产出有效工作衡量 Agent,而非只统计 Token 或任务完成声明。

来源:LangChain

🏢 AI 战略与组织变革

WorkBuddy 把 Agent 编辑接入多人共享的腾讯文档

WorkBuddy 新版本允许用户在侧边栏直接编辑 Word、PPT、Excel 和 Markdown,并把文件同步到腾讯文档。同一在线文档可由多人及各自的 Agent 共同读取和修改,共享权限、批注与任务状态成为协作底座。

来源:人人都是产品经理

字节将飞书产品并入豆包,To B 商业化并入火山引擎

字节跳动把飞书产品团队与豆包整合,由赵祺负责;飞书市场、销售和客户团队与火山引擎合并为“创造力服务平台”,由谭待统一管理。产品、企业知识与权限、云和模型部署由此进入同一组织链路。

来源:AI组织进化论

Meta 用 FBTriton 承接实验性 GPU 优化

Meta 公开 FBTriton 的工程定位:它承载 TLX、torchTLX、autoWS 等实验性 GPU 优化,并让英伟达、AMD 与学术伙伴共同测试编译器和 DSL 改动。项目以 L1/L2/L3 分层验证连接实验代码与生产上游。

来源:PyTorch

💰 资管与金融科技前沿

英国首只全原生受监管代币化基金在 Solana 发行

管理 1970 亿英镑资产的 Baillie Gifford 使用 BNY 新数字过户代理,为英国首只“全原生”受监管代币化基金提供登记基础设施;该基金 BAGEY 在 Solana 上发行。

来源:Solana

Partior 与 OpenAssets 完成代币化存款原子结算验证

Partior 与 OpenAssets 完成概念验证,让数字资产、受监管稳定币和商业银行代币化存款同步交付与支付。流程覆盖资产移动、自动账本对账和最终入账,并支持逐笔或批量实时结算。

来源:PRESS RELEASES_PR NEWSWIRE

Casap 用 Agent 自动处理八成支付争议

Casap 把支付争议的材料收集、申诉和处理流程交给 Agentic AI,披露可自动处理 80% 的案件,退款申诉胜诉率达到 97%。这把银行的争议自动化从辅助分类推进到完整案件生命周期。

来源:马克解读金融科技

🔐 安全与基础设施

俄方黑客利用 Exchange 最高危漏洞植入 OWAReaper

Proofpoint 称 TA488 正利用 Microsoft Exchange Server 最高危漏洞攻击未修补网络。用户只需在 Outlook Web Access 打开邮件就可能触发感染,攻击链最终植入用于长期访问的浏览器端 JavaScript 后门 OWAReaper。

来源:Ars Technica

AI 辅助漏洞发现推动 Chrome 每周修补两次

Google 因 AI 辅助漏洞发现加快 Chrome 更新。6 月两次更新修复的漏洞数量超过此前 23 次更新总和,浏览器补丁节奏提高到每周两次,安全团队需要适应更密集的发布与回归测试。

来源:WIRED

🎓 学术前沿

IBM 列出三项可验证的量子优势结果

IBM 在量子优势追踪器中新增三项结果,分别用不同方法处理误差并验证量子计算输出。重点不只是量子硬件快于经典计算,还要在经典模拟无法覆盖的任务上证明结果可信,避免把噪声或尚未发现的经典算法误当优势。

来源:Ars Technica

🔧 硬件算力与智能设备

Zoox 获准在拉斯维加斯运营无方向盘付费 Robotaxi

Amazon 旗下 Zoox 获得美国联邦安全标准的临时豁免,可在拉斯维加斯启动真实付费服务。车辆没有方向盘,这次许可把其无人工驾驶舱设计从免费试乘推进到商业运营。

来源:WIRED


图文卡片 ⬇️ 一键下载图文卡片