前沿科技日报 · 2026-08-03
国泰海通把多智能体接入投研全流程;微软以小模型路由和百余个智能体把漏洞复现率推至 95.95%;康奈尔让射频信号直接在微波芯片中完成特征提取。
2026-08-03 前沿科技洞见 · 日报
📊 今日关键数据
- 95.95%:微软 MDASH 在 CyberGym 中取得的漏洞复现成功率;该指标不等同于未知漏洞发现率(来源:新智元)
- 低于 200 毫瓦:康奈尔微波神经网络原型的整片功耗,在多项无线信号分类任务上准确率超过 88%(来源:DeepTech 深科技)
- 50,129 条:AXIS 论文快照收录的人类机器人演示轨迹,覆盖 207 个任务(来源:AI 提效手册)
- 35 FPS:TaoMate 在三张 GPU 上实现的完整数字人生成流水线速度,实验限于固定镜头单人场景(来源:量子位)
- 80 秒:Project Agora 六种货币代币化跨境支付试验的平均结算用时(来源:数字财经趋势)
🔍 今日值得深读
国泰海通用 1+N 多智能体覆盖投研的查、记、做
国泰海通研究所发布 Nova 投研 AI 产品矩阵:NovaStation 负责研究所级知识与数据检索,Nova 接入企业微信处理移动记录和问答,Novana 在本地桌面执行数据采集、分析和文档制作。系统已上线 11 个专项智能体和 30 余个投研 Skills;知识库支持千万级文本块溯源,并接入 8 万条行业数据指标。
- 为什么值得深读:这是一套进入证券研究真实工作流的多智能体系统,检索、权限、记忆、沙箱和本地文件防护被放在同一产品矩阵中。
- 事实边界:发布材料介绍了能力、架构和应用场景,未披露研究质量、节省工时或用户采用率等效果数据。
- 后续看点:Nova 的原文溯源、权限管控和 Novana 本地沙箱能否在正式投研任务中形成可核验的质量与合规记录。
来源:国泰海通证券研究
微软用小模型路由和多智能体把 CyberGym 漏洞复现率推至 95.95%
微软 MDASH 系统在 CyberGym 测试中取得 95.95% 的漏洞复现成功率。MAI-Cyber-1-Flash 最多承担九成查询,较难的部分交给 GPT-5.4;系统还编排百余个专用智能体完成审查、验证、去重和 PoC 生成。相较此前最强配置,微软称运行成本降低一半。
- 为什么值得深读:结果来自模型、专有安全数据和任务编排的组合,说明高频安全任务的关键变量不只是旗舰模型能力,还有路由与验证流程。
- 事实边界:CyberGym 根据漏洞描述和补丁前代码复现已知漏洞,不等同于在未知代码中自主发现新漏洞;95.95% 当时尚未进入公开榜单。
- 后续看点:MDASH 在无漏洞描述的发现任务、私有代码库和真实修复流程中能否保持相近的成功率与成本优势。
来源:新智元
MindMemOS 把智能体记忆从单个应用中拆出来
华为诺亚开源 MindMemOS,以“实体—属性—时间”保存事实及其变化,并把记忆层与 Agent 框架解耦。离线 Dreaming 机制负责合并重复信息、处理冲突和归档旧状态;任务轨迹还可转成后续调用的避错规则。系统在 LoCoMo 上得分 94.03,在 PersonaMem 上达到 70.63%。
- 为什么值得深读:它把跨应用迁移、时间演化、冲突整理和 Skill 演进放进同一记忆操作层,直接处理长期 Agent 最常见的状态污染问题。
- 事实边界:Dreaming 在测试中压缩 19.4%–23.5% 的活跃记忆,并将问答准确率最高提高 10.3 个百分点;这些结果仍受具体基准与任务协议限制。
- 后续看点:跨 Agent 迁移后,旧记忆的权限隔离、错误传播和用户纠正能否保持可追踪、可撤销。
来源:量子位
康奈尔让微波信号在芯片传播中直接完成特征提取
康奈尔大学团队提出微波神经网络,用 CMOS 波导的非线性动力学直接处理射频信号,省去模数转换后的逐步乘加运算。原型整片功耗低于 200 毫瓦,在多项无线信号分类任务上准确率超过 88%,并把卫星图像传输码率压至原来的八分之一,同时保留主要结构。
- 为什么值得深读:计算与信号传播同步发生,适合雷达、遥感和无线通信等对延迟与功耗敏感的感知前端。
- 事实边界:该芯片可编程性有限,并受热噪声、工艺偏差和温度漂移影响,短期内不能替代数字芯片执行大模型推理。
- 后续看点:团队计划把混频器、模数与数模转换器及轻量 RISC-V 控制器集成到同一芯片,目标是将编码解码系统总功耗控制在 1 瓦以下。
来源:DeepTech 深科技
AXIS 用网页众源轨迹检验机器人数据规模效应
Axis Robotics 与多所高校推出 AXIS 数据引擎。论文快照包含 207 个操作任务、50,129 条人类演示和超过 6 万种任务或场景变体;参与者只需浏览器即可遥操作仿真机械臂。清洗流程把轨迹平均加速度和加加速度分别降低 63.9% 和 80.8%,完整数据集让模型总体成功率提高 5.8 个百分点。
- 为什么值得深读:研究把任务生成、网页采集、噪声清洗、仿真增强、训练和固定协议评测连在一起,检验的不是“数据越多越好”这一口号,而是规模、覆盖与质量控制的共同作用。
- 事实边界:主要结果来自仿真轨迹和指定机器人基准,不能直接等同于真实环境中的迁移效果。
- 后续看点:持续增长的数据引擎能否在新机器人本体、真实传感噪声和未见任务上复现规模收益。
来源:AI 提效手册
Noam Brown 主张用成本曲线替代模型单点跑分
OpenAI 研究科学家 Noam Brown 在访谈中指出,模型分数会随 Token、时间和成本预算变化,未控制推理预算的单点 Benchmark 容易混淆能力与算力投入。他建议在固定预算下比较模型,或直接报告性能随预算变化的曲线;同样的问题也会影响按固定能力假设设计的安全评估。
- 为什么值得深读:当模型能长时间推理时,评测结果不再只是“模型得了多少分”,还取决于为每道题投入多少计算资源。
- 事实边界:Brown 同时强调,推理时间本身仍是瓶颈,现有模型距离“给足预算即可自主完成所有研究”还很远。
- 后续看点:模型发布方和安全评估机构是否开始同步披露 Token、时间与成本预算,并提供完整的性能曲线。
来源:Z Finance
📰 独立报道
🤖 AGI 前沿
Sol-Attn 将视频生成推理加速最高 2.1 倍
英伟达发布无需训练的稀疏注意力方法 Sol-Attn,将动态路由与近似校正在一次 online-softmax 过程中完成。公开材料称,该方法在保持视觉质量的条件下,可将视频生成推理加速最高 2.1 倍。
PALATE 用个性化标准评测角色扮演智能体
PALATE 为每名用户配置模拟评估者和个性化评分标准,用于衡量角色扮演 Agent 的多轮体验。项目同时提供数据集与 LoRA 适配器,评测对象从通用单轮得分转向不同用户在连续对话中的实际感受。
MPIE-Bench 专门检查多人图像编辑中的接触与解剖错误
MPIE-Bench 收录 2,500 个样本,测试图像编辑模型处理拥抱、搬运等多人互动时的失败。评测不再只依赖容易饱和的视觉语言模型清单,而是单独衡量人体解剖和接触几何。
3500 万参数 BarunLM 用单张 H200 完成训练
BarunLM-35M 使用约 57 亿 Token 训练,在九项零样本评测中的平均准确率为 41.01%。其架构按 3∶1 交替使用局部与全局注意力,并加入可学习残差选择器;模型仍是上下文 2048 的基础模型,不适用于医疗、法律或金融等高风险任务。
来源:机器之心
Stream3D 为冻结的 3D 生成器加入固定容量证据记忆
哈佛、MIT 与港科大团队提出 Stream3D,让现有 3D 生成器持续吸收单目视频中的多视角证据,再补全未观测表面。方法无需重新训练或改动底层生成器,并以固定容量记忆避免状态随视频长度线性增长。
来源:机器之心
TaoMate 以固定锚点抑制长视频中的角色和色彩漂移
阿里淘天与南京大学开源 TaoMate,将短期上下文与固定容量长期记忆分开,并用不可变视觉锚点约束动态状态。完整流水线在三张 GPU 上达到 35 FPS,可进行分钟级数字人生成;实验限于中英文、固定镜头和单人场景。
来源:量子位
RoboTTT 将机器人视觉动作上下文扩至 8,000 个时间步
英伟达、斯坦福与得州大学奥斯汀分校提出 RoboTTT,用 Fast Weights 在推理阶段持续更新固定大小的内部状态。按 30 Hz 控制频率计算,8,000 个时间步约为 267 秒,可让失败动作影响后续纠错,同时避免长期状态随历史持续膨胀。
VeriLoop Coder-E1 用测试反证驱动仓库级代码修复
清华团队开源基于 Qwen3.6-27B 的 VeriLoop Coder-E1。系统把代码、测试报错、工具回执和接口冲突重新编译为下一轮工作包,只让通过验证的修正进入后续循环;模型权重开放,但 Self-Harness 控制栈未一并开源。
来源:AI 提效手册
ArbiterOS 在模型与执行系统之间拦截智能体动作
香港中文大学团队开源 ArbiterOS,以拦截、解析、治理和观测四个环节约束 Agent 的工具调用。它把模型的推理与系统执行权限分层,规则层可在动作落地前检查文件、数据和外部接口访问,目标是补足提示词和沙箱之外的运行时治理。
来源:Datawhale
Scaling Law 被拆成数据、优化和架构三类误差
苏剑林用异幂不等式推导学习率与批大小的配比,并把训练损失拆为数据、优化和架构误差三部分。文章进一步讨论 MoE 与 Memory 层在算力约束下的参数分配,尝试把经验性的扩展规律转成可计算的变量关系。
来源:大模型智能
🏢 AI 战略与组织变革
Uber 为开发者设置每月 1,500 美元 AI 使用额度
Uber 披露,92% 的工程师每月使用内部 Agent,31% 的新代码由 AI 编写,Autocover 每月生成超过 5,000 个单元测试。AI 相关成本自 2024 年起增长六倍后,公司把单名开发者月度额度限制在 1,500 美元以内,并开始比较 AI 与人工代码上线后的热修复频率。
来源:AI 前线
Jeff Dean 把长期智能体的关键放在目标与反馈器
Google 首席科学家 Jeff Dean 在 YC 访谈中表示,模型在 Agent 化和长流程编码上的进步快于他的预期。下一阶段的工程重点是定义问题、搭建环境和设计反馈回路;具备可测量目标的代码、芯片布局、模型结构和材料任务更适合先进入自动实验循环。
来源:机器之心
💰 资管与金融科技前沿
Project Agora 将六种货币的代币化跨境支付缩至平均 80 秒
BIS 主导的 Project Agora 由 28 家金融机构和央行参与,完成 30 笔真实交易,覆盖六种货币和 17 类场景,总额约 80 万瑞士法郎。韩国央行披露,从支付指令发出到最终结算平均用时 80 秒;试验运行在持牌机构参与的许可体系内,尚未进入大规模应用。
来源:数字财经趋势
比特币钱包漏洞造成的损失接近 8900 万美元
一项可追溯至 2021 年的比特币钱包缺陷,使攻击者能够离线重建有限集合中的私钥。相关攻击损失接近 8900 万美元,说明长期潜伏的密钥生成缺陷会在链上资产中形成不可逆的集中风险。
来源:Tech in Asia
🎓 学术与行业应用前沿
影禾医脉称 CT 报告可在一分钟内生成,九成无需修改
影禾医脉首席医疗官孟滔介绍,公司系统可在一分钟内生成 CT 报告,约 90% 无需修改。其“河图计划”重点不是更换模型架构,而是统一检查项目、报告风格和病变描述,建立可治理的医学影像标注体系;短期应用仍定位为医生与 AI 协作。
来源:虎嗅