前沿科技日报 · 2026-08-03
微软用多智能体编排把漏洞复现率推至 95.95%;机器人获得近五分钟工作记忆;国泰海通与 Project Agorá 分别把智能体和代币化结算带进真实金融流程。
2026-08-03 前沿科技洞见 · 日报
📊 今日关键数据
- 95.95%:微软公布 MDASH 在 CyberGym 上的漏洞复现成功率,运行成本为此前最强配置的一半(来源:新智元-公众号)
- 8,000 个时间步:RoboTTT 将机器人视觉—动作上下文扩展到近五分钟,同时保持恒定推理延迟(来源:十字路口Crossing-公众号)
- 80 秒:Project Agorá 的 30 笔真实跨境交易从发出指令到最终结算的平均耗时(来源:数字财经趋势)
- 35 FPS:TaoMate 在三张 GPU 上实现完整音视频流水线输出,并支持分钟级稳定生成(来源:量子位-公众号)
- 7 万个 CPU 核心:Uber 的动态 Go 运行时调优已在 30 个关键服务中回收的计算资源(来源:AI前线)
- 低于 200 毫瓦:康奈尔微波神经网络芯片直接处理射频信号时的功耗(来源:DeepTech深科技-公众号)
🔍 今日值得深读
微软 MDASH 用小模型分流九成查询,漏洞复现率升至 95.95%
微软公布多模型安全系统 MDASH 的 CyberGym 测试结果:漏洞复现成功率为 95.95%,运行成本是此前最强配置的一半。系统包含百余个专用智能体,最多九成查询交给激活参数 5B 的 MAI-Cyber-1-Flash,最难的部分再由 GPT-5.4 处理。该成绩测试的是根据漏洞描述和补丁前代码生成 PoC,并非在陌生代码中发现未知漏洞;95.95% 也尚未进入公开榜单。
- 关键事实:CyberGym 包含 188 个开源项目的 1,507 个真实漏洞,MDASH 公布的成绩较榜单原有 88.4% 结果进一步提高。
- 为什么值得深读:能力增量来自模型路由、验证流程和安全数据的共同作用,说明专用小模型可以承担高频任务,旗舰模型只处理难例。
- 后续看点:微软公布的 95.95% 能否进入 CyberGym 公开榜单,以及 8 月 3 日公开预览的 Project Perception 如何保留人工确认环节。
来源:新智元-公众号
RoboTTT 把机器人视觉—动作上下文扩展至 8,000 个时间步
英伟达与斯坦福等机构发布 RoboTTT。框架借助 Fast Weights,在推理时持续更新内部参数,把机器人视觉—动作上下文扩展到 8,000 个时间步,相当于近五分钟工作记忆。历史长度增加时,推理延迟保持恒定;机器人还可利用失败动作的上下文调整后续操作。
- 关键事实:RoboTTT 让长时记忆进入模型参数更新,而不是持续扩张上下文缓存。
- 为什么值得深读:长程操作的瓶颈由“能否记住”推进到“能否从失败中实时修正”,且不让延迟随历史线性增长。
- 后续看点:更长预训练上下文能否继续提高闭环任务成功率,以及近五分钟记忆在真机长任务中的稳定性。
国泰海通发布 Nova 投研智能体矩阵,覆盖研究、移动与数据场景
国泰海通研究所发布 Nova 投研 AI 产品生态,由 NovaStation、Nova 和 Novana 组成,分别覆盖研究工作台、移动办公和深度数据场景。NovaStation 采用“1 个通用调度智能体 + N 个专项智能体”架构,已上线 11 个专项智能体和 30 余个投研 Skills,并接入 8 万条行业数据指标。
- 关键事实:系统以多路召回、混合检索和多次重排定位千万级文本块,答案可追溯到原文段落。
- 为什么值得深读:投研智能体的产品边界从单点问答扩展到研究所级知识、数据和任务调度,溯源成为正式工作流的一部分。
- 后续看点:11 个专项智能体在公司研究、产业链梳理等真实任务中的溯源准确率、人工复核量和跨端衔接效果。
来源:国泰海通证券研究
Project Agorá 用真实资金完成 30 笔代币化跨境结算
国际清算银行主导的 Project Agorá 完成代币化跨境支付实盘试验。28 家金融机构和央行参与了 30 笔真实交易,覆盖 17 种场景和六种货币,总额约 80 万瑞士法郎;从发出指令到最终结算平均耗时 80 秒。传统跨境汇款通常需要 1 至 3 个工作日。
- 关键事实:试验把央行储备与商业银行存款放在共享账本上,以“支付即结算”减少代理行之间的逐层核验和对账。
- 为什么值得深读:测试对象不是演示代币,而是多央行、多商业银行和真实资金共同参与的跨境结算流程。
- 后续看点:平台能否从 30 笔试验扩展到常态交易,并在同一流程中处理更大规模的合规、流动性和互操作性要求。
来源:数字财经趋势
Noam Brown:模型评测应同时给出推理预算与能力曲线
OpenAI 研究科学家 Noam Brown 在访谈中指出,当前 Benchmark 常未控制推理 Token、时间或成本,单点分数会混入预算差异。他建议把模型表现画成随预算变化的函数曲线;同一模型获得 10 美元与 1,000 万美元推理预算时,可完成的任务不同,安全评估也应纳入这一变量。
- 关键事实:Brown 将测试时计算视为模型能力的一部分,同时强调长时间推理本身仍是瓶颈。
- 为什么值得深读:如果评测不披露预算,模型采购、安全分级和跨代比较都可能把算力投入误当成能力跃迁。
- 后续看点:模型发布与负责任扩展政策是否开始同时披露性能、Token、时间和成本曲线。
📰 独立报道
🤖 AGI 前沿
OpenWorker 把本地权限分级接入桌面 Agent
吴恩达与 Rohit Prasad 开源桌面 Agent OpenWorker。项目基于 Tauri、React 和 Python,本地运行,集成 25 个以上远程工具并支持 MCP 与多模型;涉及发消息、改日历或执行命令时会先请求确认,无人值守期间则暂停任务并写入收件箱。
PALATE 用个性化规则评测角色扮演 Agent 的多轮体验
PALATE 提出面向角色扮演 Agent 的新基准:以逐用户模拟评估器和个性化评分规则衡量真实多轮交互,而非只看统一答案。项目同时提供数据集与 LoRA 适配器,为人格一致性和用户差异提供可复核的评测入口。
Sol-Attn 无需训练,把视频生成推理加速至 2.1 倍
英伟达发布稀疏注意力方法 Sol-Attn,在不追加训练的条件下,将视频生成推理最高加速至 2.1 倍,同时保持视觉质量。方法把动态路由与近似校正放进一次 online-softmax 计算,并公开论文、项目和代码入口。
MPIE-Bench 用 2,500 个样本检查多人图像编辑的接触关系
MPIE-Bench 收录 2,500 个多人互动编辑样本,覆盖拥抱、搬运等容易出现肢体与接触错误的场景。评测直接检查解剖结构和接触几何,试图替代已经趋于饱和的视觉语言模型清单式打分。
3,500 万参数 BarunLM 在九项零样本基准平均得分 41.01%
独立开发者公开 BarunLM-35M 的模型权重、训练和推理代码及完整评测。作者给出的九项零样本基准平均准确率为 41.01%,超过约为其 6.55 倍参数量的 LFM2.5-230M-Base;模型仅使用一张 H200 训练,但成绩仍是作者自报结果。
来源:机器之心
Stream3D 用固定容量记忆连接流式重建与生成
哈佛、MIT 与港科大团队提出 Stream3D。它给冻结的视图条件 3D 生成器增加无需训练的流式机制,持续筛选多视角证据并补全未观测表面;固定容量证据记忆避免状态随视频长度线性增长,也不修改底层生成器结构。
来源:机器之心
TaoMate 以固定视觉锚点支撑分钟级数字人生成
阿里淘天与南京大学推出并开源 TaoMate。框架把历史拆成有界活动上下文与固定容量持久记忆,用不可变视觉锚点抑制人物外观和颜色漂移;在三张 GPU 上,完整音视频流水线达到 35 FPS,支持分钟级稳定生成与流式交互。
来源:量子位-公众号
MindMemOS 将 Agent 记忆从单一框架中解耦
华为诺亚开源 MindMemOS 记忆操作层,以实体、属性、时间三维结构保存最新状态与演化轨迹。其 Dreaming 机制在离线阶段消解冲突、压缩冗余,Feedback 模块利用用户纠正调整记忆权重,使同一套记忆可以跨 Agent 和应用复用。
来源:量子位-公众号
AXIS 用五万条网页众源轨迹训练机器人模型
Axis Robotics 与多所高校推出 AXIS 数据引擎,通过浏览器遥操作收集超过 5 万条仿真轨迹。清洗、任务覆盖和数据增强共同决定规模收益;完整数据集使模型总体成功率提高 5.8%,说明轨迹数量必须与质量控制一起增长。
来源:AI提效手册
世界模型的瓶颈落在动作数据、目标函数与闭环评测
一篇技术分析将世界模型与多模态生成区分开来:前者需要把感知、状态、动作、时间和结果闭合,视频逼真度不能替代规划成功率。文章指出,动作与力数据稀缺、多种未来并存以及物理错误代价高,是参数扩张之外的主要约束。
来源:虎嗅-前沿科技-网站
Scaling Law 被拆成数据、优化与架构三类误差
苏剑林用异幂不等式推导最优学习率与批大小的配比,并将训练损失拆成数据误差、优化误差和架构误差。该框架还讨论了 MoE 与 Memory 层在算力约束下的参数分配,为经验拟合增加可解释的变量分解。
来源:大模型智能-公众号
🏢 AI 战略与组织变革
Uber 从 30 个关键服务回收 7 万个 CPU 核心
Uber 推行“零增长技术栈”,用动态运行时控制和 AI 生命周期管理压低基础设施扩张。GOGCTunner 根据 cgroup 内存限制与实时对象使用量调整 Go 垃圾回收参数,已在 30 个关键服务中回收 7 万个 CPU 核心;控制目标在堆大小与 70% 内存使用阈值之间保持平衡。
来源:AI前线
Claude 重写桌面应用的实验运行两周仍未结束
Claude Code 负责人 Boris Cherny 在访谈中说,他让 Claude 在 macOS 虚拟机中运行 Electron 版应用,逐像素对比并用 Swift 重写;任务运行 14 至 15 天后仍未完成。Cherny 将验证视为高难任务中最容易缺失的环节,这个实验也显示超长任务不等于已经形成可交付软件。
🔧 硬件算力与智能设备
康奈尔微波神经网络以低于 200 毫瓦功耗直接处理射频信号
康奈尔大学团队提出微波神经网络芯片,让波导中的非线性物理过程直接提取射频特征,省去模数转换与数字神经网络处理。芯片功耗低于 200 毫瓦,还可把图像传输码率压缩到八分之一并保留关键特征。