前沿科技日报 · 2026-08-02
OpenAI 把多智能体长程协作推进到数学研究;GitHub Agentic Workflows 暴露跨仓库提示注入风险;KDA 架构首次在全市场选股测试中给出可复核结果。
2026-08-02 前沿科技洞见 · 日报
📊 今日关键数据
- 10 道、约 2000 美元:OpenAI 报告称 Astra 生成了十道长期未解数学问题的论证,完成全部求解的算力成本约 2000 美元(来源:华尔街见闻全球)
- 80% 以上:Claude Code 团队在 Opus 5 上线后删除了超过八成系统提示词,并重新做逐项消融验证(来源:AI前线)
- 241.44% / -35.67%:Kimi Linear 选股模型的费后累计收益为 241.44%,最大回撤为 -35.67%,收益高于对照模型但回撤也更大(来源:QuantML)
- 12.66 FPS:LiveEdit 在 4 步推理下处理 81 帧视频总耗时 7.89 秒(来源:机器之心)
- 20% / 11%:对 756 块 GPU 的 31 天遥测显示,约两成执行时间和一成能耗消耗在等待状态(来源:钛媒体)
🔍 今日值得深读
OpenAI Astra 用多智能体协作求解十道长期未解数学题
OpenAI 披露,未发布的 Astra 模型家族可驱动多个智能体长时间协同处理复杂任务。其报告称,Astra 生成了十道数学与理论计算机科学问题的论证,人类研究员负责整理手稿、转写 Lean 代码并对正确性负责;完成全部求解的算力成本约 2000 美元。模型仍处测试阶段,发布日期和最终命名尚未确定。
- 为什么值得深读:这套流程把模型生成、人工审阅与形式化验证接在一起,给“AI 产出研究结果如何被验证和署名”提供了具体案例。
- 事实边界:十项结果及成本来自 OpenAI 报告,正式输入未提供独立复现结论。
- 后续看点:这些证明公开后,数学界能否逐项复核 Lean 形式化结果,以及 Astra 发布前将接受何种备案审查。
来源:华尔街见闻全球
GitHub Agentic Workflows 被一句隐藏指令诱导泄露私有仓库数据
Noma Security 披露 GitLost:攻击者把隐藏指令放进公开 Issue,便可诱导拥有跨仓库读取权限的 GitHub Agentic Workflow 访问受限文件,再通过公开评论工具泄露内容。研究者称,关键词 “Additionally” 即可越过既有防护;攻击者不需要代码能力、凭据或组织访问权。
- 为什么值得深读:Agent 同时接触不可信输入、私有数据和公开写入工具时,传统的仓库权限边界会被模型行为串联起来。
- 事实边界:材料描述的是一个具体工作流配置及其概念验证,不代表所有 GitHub Agent 工作流都能被同样利用。
- 后续看点:GitHub 是否收紧跨仓库 Token 权限,并把外部 Issue 内容与 Agent 指令上下文强制隔离。
来源:AI前线
Claude Code 团队为 Opus 5 删除超过 80% 的系统提示词
Claude Code 创始人 Boris Cherny 表示,团队在 Opus 5 上线后删除了超过 80% 的系统提示词。新模型发布时,团队会先清空系统提示词,再通过消融实验逐行加回必要内容;工具集合和 Harness 代码也会随模型能力变化而删改。他还披露,Claude 将 Electron 桌面应用改写为 Swift 的实验已连续运行两个多星期,可能调用了数千至数万个智能体。
- 为什么值得深读:模型升级会让旧提示词、工具和评测迅速失效,Agent 产品需要重新验证脚手架,而不是持续累加规则。
- 事实边界:提示词删减比例和长程实验规模来自 Cherny 的一手访谈,材料没有提供完整消融数据。
- 后续看点:Claude Code 后续版本会保留哪些系统提示与工具,以及 Swift 重写任务能否完成逐像素验收。
来源:AI前线
KDA 架构迁移到 Qlib 选股模型,累计收益更高但回撤扩大
QuantML 将 Kimi 的 KDA 递推状态、通道级衰减门和 delta-rule 写入机制迁移到 Qlib 选股模型,并用参数量相近的 Transformer 作对照。测试覆盖 5543 只证券、5735658 条样本:Kimi Linear 的费后累计收益为 241.44%,Transformer 为 202.43%;前者最大回撤为 -35.67%,也高于后者的 -29.64%,超额 IR 则略低。
- 为什么值得深读:它把长上下文模型的选择性记忆机制放进金融时序任务,同时呈现收益、回撤与风险调整后表现的差异。
- 事实边界:结果来自单一团队在固定训练区间、特征集和周频 Top200/drop20 策略下的测试,不能直接外推到实盘。
- 后续看点:代码公开后,其他市场、时间窗口和交易成本设定能否复现四项 IC 指标与收益差异。
来源:QuantML
明尼苏达州 AI “脱衣”应用禁令在 xAI 诉讼期间生效
美国联邦法官 Donovan Frank 拒绝 xAI 暂停明尼苏达州禁令的请求,该州禁止用 AI 生成未经同意的裸照。法官指出,法律签署近三个月后,xAI 才在生效前三天申请临时限制令,因此没有证明伤害具有紧迫性。裁定没有终结诉讼,只允许禁令在案件审理期间生效。
- 为什么值得深读:这是美国首个同类州级禁令进入执行阶段,生成模型的产品控制与言论边界将由后续诉讼继续检验。
- 事实边界:本次裁定聚焦临时限制令与起诉时机,没有对法律实体争议作最终判决。
- 后续看点:法院后续如何处理 xAI 关于法律范围过宽、存在更温和替代措施的主张。
来源:TechCrunch
📰 独立报道
🤖 AGI 前沿
BM25 在约 1000 万 Token 后反超智能体搜索
一项 RAG 扩展研究发现,智能体搜索在小语料库领先,但随着语料增长,词法检索 BM25 在约 1000 万 Token 处反超,并在更大规模上保持优势。结果提示,复杂搜索策略的收益会随语料规模改变,检索架构不能只用小规模基准选型。
Beacon 让视觉推理 Agent 先判断是否需要调用工具
Beacon 为智能体视觉推理引入 Mode Adaptiveness 与 Tool Effect 两项机制,先判断样本是否需要工具、工具是否会带来增益,再决定调用。目标是减少简单样本上的无效工具使用,避免额外计算反而拉低表现;论文同时提供数据集和代码入口。
Memory Decoder 把长期记忆与推理解耦,扩展至 69 亿参数
Memory Decoder 提出预训练参数化长期记忆模块,把记忆存储与推理过程拆开。正式材料显示,该路线已扩展至 69 亿参数和 3000 亿训练 Token,并开放论文、模型与数据入口,为长程任务提供不同于持续扩大上下文窗口的实现路径。
JarvisHub 用可编辑画布保存长程多模态创作状态
JarvisHub 将提示词、参考素材、候选版本、依赖关系和失败记录放进同一张可编辑画布,作为用户与 Agent 的共享项目状态。协议桥会校验每次工具调用和画布变更,让 Agent 能局部修复失败节点,并保留动作、版本与证据轨迹。
来源:机器之心
🎓 学术前沿
VideoCoCo 用可执行 Blender 程序约束视频物理过程
VideoCoCo 让编码 Agent 先编写 Blender 程序,生成确定性的时空运动草稿,再通过条件编辑转成写实视频。可执行程序充当视频生成的推理链,把物体运动与交互先落到可模拟过程,再交给生成模型处理外观。
Light-MER 用 8.55 亿参数超过 80 亿参数教师模型的平均表现
Light-MER 通过 SWD-H 隐藏状态蒸馏和 M-GRPO 多奖励优化,将生成式多模态情感识别压到约 8.55 亿参数。论文在九个公开数据集上测试,平均表现超过 80 亿参数教师模型;参数量与 FLOPs 约降 11 倍,峰值显存降至 2.54GB。
来源:新智元
LiveEdit 用 4 步去噪把流式视频编辑推进到 12.66 FPS
清华大学与香港科技大学团队提出 LiveEdit,通过三阶段蒸馏把扩散推理从 100 步压到 4 步,并用掩码缓存复用未编辑区域的特征。系统处理 81 帧视频总延迟为 7.89 秒,达到 12.66 FPS;论文代码和模型已开放。
来源:机器之心
Frontis-MA1 在 MLE-Bench Lite 获得 71.21% 奖牌均值
Frontis-MA1 是一个面向机器学习工程的 350 亿参数元进化 Agent,训练于开放的递归自改进系统 OpenMLE。正式材料称,它在 MLE-Bench Lite 达到 71.21% 奖牌均值,超过 GPT-5.5 与 Codex,并提供论文、代码和数据集合入口。
真实 V8 漏洞环境让安全 Agent 用确定性判分
卡内基梅隆大学教授、Bugcrowd 首席 AI 与科学官 David Brumley 介绍了一套可复现的强化学习安全环境:判分器直接检查利用是否触发指定漏洞,不让模型自行宣称成功。测试覆盖 41 个真实 V8 漏洞,最强模型约达 95%,并在困难样本中生成了真实沙箱逃逸利用和一个零日漏洞。
来源:AI Engineer
infini-gram 追踪 AI 文本与既有语料的逐字重合
Allen Institute for AI 介绍 infini-gram:系统索引大规模公开文本,统计任意长度短语的出现位置与频次,用来补足普通 AI 写作检测器无法给出来源的问题。研究者在各 200 本自出版书样本中发现,检测到大量 AI 文本的书里,稀有重合短语占 41.6%;对照组为 37.2%。
💰 资管与金融科技前沿
温州把数据安全、产权、知识产权和资产凭证合并办理
温州推出数据要素“四证同办”,将安全合规评审证、数据产权证、数据知识产权证和数据资产证串进同一流程。当地由司法、财政、市场监管、数据等 10 余个部门组成工作组,每月集中评审数据项目;数安港已吸引超过 1200 家数据生态企业入驻。
来源:中国青年网
🔧 硬件算力与智能设备
澜起科技量产 CXL 3.2 芯片,传输速率最高 64 GT/s
中国芯片厂商澜起科技开始量产 CXL 3.2 芯片。正式材料披露,芯片最高数据传输速率为 64 GT/s,并集成双 DDR5 控制器,面向处理器与内存之间的高速互连需求。
来源:Tech in Asia
学术集群近两成 GPU 执行时间耗在等待
一项针对 756 块 GPU、持续 31 天的细粒度遥测发现,集群约 20% 的执行时间和 11% 的能耗消耗在同步、数据搬运等等待状态。材料还显示,Azure Code 与 Chat 类推理负载的空转能耗分别达到 65% 和 52%,说明高 GPU 利用率并不等于高有效吞吐。
来源:钛媒体