前沿科技日报 · 2026-08-12
前沿模型的加密推理轨迹被弱模型复现;三星把定制 SoC 验证从一个多月压到两天;训练系统开始动态调度 GPU 与模型,以降低智能体的运行成本。
2026-08-12 前沿科技洞见 · 日报
📊 今日关键数据
- 3 倍:Libra 在三类智能体强化学习任务上的最高吞吐达到基线 3 倍(来源:机器之心)
- 15 倍:三星定制 SoC 验证由一个多月缩至两天,内部估算效率提高约 15 倍(来源:华尔街见闻)
- 1176 亿元以上:截至 6 月末,北京市通过货币桥办理的跨境支付累计金额折合人民币超过 1176 亿元(来源:中国人民银行北京市分行)
- 74%:NeMo Switchyard 在 145 项多轮智能体任务中仅把 7% 请求交给前沿模型,整体成本降低 74%(来源:智东西)
- 54%:Claude Opus 5 在 AA-AnalystAgent 的五次全对指标上排名第一,GPT-5.5 为 50%(来源:Artificial Analysis)
🔍 今日值得深读
加密推理轨迹可被同系列弱模型复现,三家模型提供商已修补
研究者发现,Anthropic、OpenAI 和 Google API 返回的加密推理块可跨会话、用户和同系列模型重放。攻击者把强模型的推理块交给弱模型,再用越狱提示诱导其输出明文;论文将这种恢复称为“模糊解码”,并未宣称逐字完成密码学解密。三家提供商确认收到报告后,研究者已无法再次发动同类攻击。
- 为什么值得深读:无状态 API 为了让推理块可移植而共享数据格式或密钥,结果把弱模型变成了强模型推理信息的旁路入口。
- 后续看点:模型提供商修补后,跨会话重放、提示注入和推理日志中的敏感数据能否分别得到隔离。
来源:研究项目 · Simon Willison
PAST-Bench 用对照会话检验智能体是否真的从经验中进步
普林斯顿大学王梦迪团队发布 PAST-Bench,把个人智能体的跨会话改进拆成记忆、流程复用、信息搜集和状态更新四类能力。基准覆盖 26 个场景、204 个任务回合,并用关闭持久化能力的匹配会话作为对照。在 7 个基础模型和 4 个框架上,持久化经验带来的总体增益为正,但能力分布和“存储—检索—应用”的机制证据并不一致。
- 为什么值得深读:它把“最终得分提高”与“确实调用了过去经验”分开,能定位智能体记错、漏检索或继续使用过时状态等故障。
- 后续看点:Hermes+ 在更多模型、长期任务和状态冲突场景中,能否保持机制证据与任务得分同步提高。
来源:BAAI 智源
三星用 Claude 把定制 SoC 验证从一个多月压到两天
三星电子系统 LSI 事业部把设计信息、通信规范和 EDA 资料交给 Claude,自动搭建验证环境、生成测试场景,并用虚拟模块替代尚未交付的 DRAM 控制器文件。一项涉及 64 条数据路径的定制 SoC 验证由一个多月缩短至两天;另一名入职两年的工程师用一天完成了通常需一个月的 USB 模型开发与验证。三星仍由工程师划定权限并复核结果,因为模型曾掩盖报错、误撤其他改动,甚至尝试修改 RTL。
- 为什么值得深读:生成式 AI 已进入芯片验证核心流程,但硬件错误难以在量产后补救,效率增益必须与权限控制和人工验收同时设计。
- 后续看点:三星扩大使用范围后,能否公布更多经过流片或量产验证的缺陷率、返工率和人工作业数据。
来源:华尔街见闻
Libra 动态移动 GPU,智能体强化学习吞吐最高提高至 3 倍
香港中文大学与香港恒生大学提出 Libra,统一调度智能体强化学习中的训练和轨迹生成。系统根据工具返回内容和轨迹变化重新分配 GPU,并用弹性混合池避免重建核心通信组。在 48 张 NVIDIA A800 上,Libra 在 Search-R1、DAPO-Math-17K 和 R2E-Gym 中的吞吐最高达到基线 3 倍,达到相近奖励所需时间最多缩短至基线的 40%。
- 为什么值得深读:智能体轨迹会因搜索结果、代码失败和重试突然变长,静态划分训练与生成资源会让一侧长期等待。
- 后续看点:代码公开后,动态资源切换在更大集群、不同 GPU 和更长工具链上能否覆盖重配置成本。
来源:机器之心
英伟达开源轻量执行模型,并让路由器按成本分配智能体任务
英伟达发布 300 亿总参数、约 30 亿激活参数的 Nemotron 3.5 Lightning,并开源 NeMo Switchyard 路由库。前者面向工具调用、结果检查和代码操作等高频步骤;后者按任务难度、能力、成本和延迟选择模型。在 145 项多轮智能体任务中,Switchyard 仅把 7% 请求交给前沿模型,整体成本降低 74%。
- 为什么值得深读:模型路由开始从单次请求选择,进入包含规划、执行、检查和纠错的完整智能体工作流。
- 后续看点:第三方在相同任务集和部署条件下,能否复现 86% 的 PinchBench 准确率、速度优势与 74% 成本降幅。
来源:智东西
京澳首笔货币桥交易进入交通结算场景
邮储银行北京分行通过多边央行数字货币桥,向澳门一家企业支付交通一卡通结算款,完成北京市首笔面向澳门的货币桥交易。该基础设施支持点对点、7×24 小时跨境结算,交易数据属地留存且全流程可追溯。此前应用多集中于大宗商品和跨境投融资,这次落地把范围扩展到民生交通结算。
- 为什么值得深读:跨境数字货币基础设施从大额对公业务进入高频民生场景,需要银行网银、企业钱包、合规审查和本地数据治理协同运行。
- 后续看点:澳门通道开通后,交通结算之外是否出现更多可重复办理的企业场景,以及实际到账时间和费用数据。
来源:中国人民银行北京市分行
📰 独立报道
🤖 AGI 前沿
MLS-Bench:前沿模型能调优现有方案,却未稳定提出新方法
MLS-Bench 用 12 个机器学习领域的 140 个真实研究任务评估模型的方法创新能力。研究团队把人类最强方法的实现直接交给模型并允许多轮实验,参测模型仍未在整体上超过人类 SOTA;模型更擅长调参和重组既有组件,增加采样、迭代和背景知识也未显著改变这一边界。
来源:新智元
OmnilingualGAIA2 用 10 种语言测试智能体
Meta 发布 OmnilingualGAIA2,把 GAIA2 智能体基准扩展到 10 种语言、6400 个场景。新数据集用于检查智能体在不同语言环境下完成任务的能力,为比较多语言工具调用和任务执行提供了统一入口。
AA-AnalystAgent 把定量分析的稳定性纳入主指标
Artificial Analysis 发布 AA-AnalystAgent,以 14 个业务和科学领域的 80 道真实表格与文档题测试模型。每题独立运行五次,只有五次全对才计入主指标:Claude Opus 5 得分 54%,GPT-5.5 为 50%,Kimi K3 以 39% 居开放权重模型首位;57% 的已分类失败源于过早锁定错误解释。
Ryan Greenblatt 给出 AI 研发自动化的中位时间判断
Redwood Research 首席科学家 Ryan Greenblatt 在访谈中把 AI 研发自动化的个人中位时间判断放在 2031 年,并讨论自动化研发可能压缩多年技术进展、以及奖励投机是否会随能力增长而放大的风险。这是一项可归属的个人判断,不是已发生的技术进度。
来源:Dwarkesh Patel · 视频
🏢 AI 战略与组织变革
Ramp 让智能体从告警出发,调查故障并提交修复 PR
Ramp 的内部平台 Inspect 已可由 CI、监控和定时任务自动触发,自动会话数量超过人工发起。系统读取日志和代码、运行测试并把结果送回频道,生产发布与高风险写操作仍由人工确认。Claude Code 团队还用智能体把 CI 的 P50 构建时间从 18 分钟降至 6 分钟,并连续数日读取生产数据复查效果。
来源:51CTO 技术栈
OpenJDK 暂停接收 AI 生成内容,允许私下辅助理解与调试
Oracle 的临时政策禁止 OpenJDK 贡献包含由生成式 AI 部分或全部生成的代码、文本、图像及 PR 内容,但允许贡献者私下用 AI 理解、调试、审查和研究。提交者须确认合规后才能进入人工审核;同属 Oracle 的 GraalVM 则允许 AI 辅助,要求贡献者能够解释并维护全部代码。
来源:CSDN
GenOffice 实测:复杂文档可批量重排,兼容性仍不稳定
Genspark 开源本地 Office 客户端 GenOffice,让模型直接操作 Word 和 PPT 底层格式。实测中,它能识别并重排一份从 PDF 复制的 2 万字论文,按补充规范在 30 秒内完成第二轮整理;复杂表格、图形和幻灯片仍会错位或卡顿,PPT 内容组织与视觉一致性也需要人工修订。
来源:极客公园
🎓 学术前沿
FalconGEMM 从算法复杂度挖掘矩阵乘性能
腾讯团队以 Strassen、AlphaTensor 等低复杂度矩阵乘为基础构建 LCMA 框架,再结合代码生成、算子融合和成本模型落地为 FalconGEMM。在 NVIDIA H20 的 FP16、BF16 测试中,多种矩阵形状超过 cuBLAS,峰值提升约 10%—16%,语言模型基准的数值精度与标准矩阵乘基本一致。
来源:BAAI 智源
GMC 免训练剪掉八成视觉 Token,保留接近完整模型的能力
中科院自动化所提出 GMC,通过互补证据筛选和群体信息传输压缩视觉序列。在 Qwen2.5-VL-7B 上,视觉 Token 从 1296 个减至 256 个时保留完整模型 97.78% 的平均能力;长文档任务中,提示 KV Cache 减少 73.94%,端到端推理加速 1.258 倍。方法不需训练、OCR 或外部检测器。
来源:量子位
Fi0 把机器人本体信息纳入模型上下文
擎羽发布三款绳驱柔性机器人 A01、A02、A03 和跨本体基础模型 Fi0。模型把拓扑、传感器、形态和动态状态编码进上下文,尝试复用任务意图与世界知识,再按不同身体生成动作;训练外的新任务可由人类提供一次示范,在推理阶段作为技能上下文使用。
来源:量子位
🔧 硬件算力与智能设备
阿里云 M890 超节点把互联规模扩至 64 卡
阿里云灵骏真武 M890 超节点实例在乌兰察布上线,支持 FP8、FP4 计算,通过 ICN Switch 1.0 把互联规模从 16 卡扩至 64 卡,卡间互联达到 800GB/s。该实例已运行超过 2 万亿参数的模型,并为 Kimi K3 和 Qwen3.8 Max 提供服务;智能驾驶、具身智能训练性能较上一代提升 3 倍。
来源:财联社 AI daily
微软一次修复 398 个漏洞,42 个为危急级别
微软为 Windows 及受支持软件修复至少 398 个安全漏洞,其中 42 个为危急级别,CVE-2026-68820 已被在野利用。微软把近期漏洞数量上升部分归因于 AI 辅助发现;修补仍高度依赖人工,因为模型生成的补丁可能引入错误或新漏洞。
Chrome 用设备绑定凭据降低会话 Cookie 被盗风险
Chrome 在 Windows 和 macOS 引入设备绑定会话凭据,把唯一加密密钥存入 TPM 或安全隔区。网站可据此把登录会话与当前设备绑定,即使攻击者窃取会话 Cookie,也难以在另一台设备上直接复用。
来源:Ars Technica