🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-08-02

OpenAI 把多智能体长程协作推进到数学研究;GitHub Agentic Workflows 暴露跨仓库提示注入风险;KDA 架构首次在全市场选股测试中给出可复核结果。

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-08-02 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

OpenAI Astra 用多智能体协作求解十道长期未解数学题

OpenAI 披露,未发布的 Astra 模型家族可驱动多个智能体长时间协同处理复杂任务。其报告称,Astra 生成了十道数学与理论计算机科学问题的论证,人类研究员负责整理手稿、转写 Lean 代码并对正确性负责;完成全部求解的算力成本约 2000 美元。模型仍处测试阶段,发布日期和最终命名尚未确定。

来源:华尔街见闻全球

GitHub Agentic Workflows 被一句隐藏指令诱导泄露私有仓库数据

Noma Security 披露 GitLost:攻击者把隐藏指令放进公开 Issue,便可诱导拥有跨仓库读取权限的 GitHub Agentic Workflow 访问受限文件,再通过公开评论工具泄露内容。研究者称,关键词 “Additionally” 即可越过既有防护;攻击者不需要代码能力、凭据或组织访问权。

来源:AI前线

Claude Code 团队为 Opus 5 删除超过 80% 的系统提示词

Claude Code 创始人 Boris Cherny 表示,团队在 Opus 5 上线后删除了超过 80% 的系统提示词。新模型发布时,团队会先清空系统提示词,再通过消融实验逐行加回必要内容;工具集合和 Harness 代码也会随模型能力变化而删改。他还披露,Claude 将 Electron 桌面应用改写为 Swift 的实验已连续运行两个多星期,可能调用了数千至数万个智能体。

来源:AI前线

KDA 架构迁移到 Qlib 选股模型,累计收益更高但回撤扩大

QuantML 将 Kimi 的 KDA 递推状态、通道级衰减门和 delta-rule 写入机制迁移到 Qlib 选股模型,并用参数量相近的 Transformer 作对照。测试覆盖 5543 只证券、5735658 条样本:Kimi Linear 的费后累计收益为 241.44%,Transformer 为 202.43%;前者最大回撤为 -35.67%,也高于后者的 -29.64%,超额 IR 则略低。

来源:QuantML

明尼苏达州 AI “脱衣”应用禁令在 xAI 诉讼期间生效

美国联邦法官 Donovan Frank 拒绝 xAI 暂停明尼苏达州禁令的请求,该州禁止用 AI 生成未经同意的裸照。法官指出,法律签署近三个月后,xAI 才在生效前三天申请临时限制令,因此没有证明伤害具有紧迫性。裁定没有终结诉讼,只允许禁令在案件审理期间生效。

来源:TechCrunch


📰 独立报道

🤖 AGI 前沿

BM25 在约 1000 万 Token 后反超智能体搜索

一项 RAG 扩展研究发现,智能体搜索在小语料库领先,但随着语料增长,词法检索 BM25 在约 1000 万 Token 处反超,并在更大规模上保持优势。结果提示,复杂搜索策略的收益会随语料规模改变,检索架构不能只用小规模基准选型。

来源:HuggingPapers

Beacon 让视觉推理 Agent 先判断是否需要调用工具

Beacon 为智能体视觉推理引入 Mode Adaptiveness 与 Tool Effect 两项机制,先判断样本是否需要工具、工具是否会带来增益,再决定调用。目标是减少简单样本上的无效工具使用,避免额外计算反而拉低表现;论文同时提供数据集和代码入口。

来源:HuggingPapers

Memory Decoder 把长期记忆与推理解耦,扩展至 69 亿参数

Memory Decoder 提出预训练参数化长期记忆模块,把记忆存储与推理过程拆开。正式材料显示,该路线已扩展至 69 亿参数和 3000 亿训练 Token,并开放论文、模型与数据入口,为长程任务提供不同于持续扩大上下文窗口的实现路径。

来源:HuggingPapers

JarvisHub 用可编辑画布保存长程多模态创作状态

JarvisHub 将提示词、参考素材、候选版本、依赖关系和失败记录放进同一张可编辑画布,作为用户与 Agent 的共享项目状态。协议桥会校验每次工具调用和画布变更,让 Agent 能局部修复失败节点,并保留动作、版本与证据轨迹

来源:机器之心

🎓 学术前沿

VideoCoCo 用可执行 Blender 程序约束视频物理过程

VideoCoCo 让编码 Agent 先编写 Blender 程序,生成确定性的时空运动草稿,再通过条件编辑转成写实视频。可执行程序充当视频生成的推理链,把物体运动与交互先落到可模拟过程,再交给生成模型处理外观。

来源:HuggingPapers

Light-MER 用 8.55 亿参数超过 80 亿参数教师模型的平均表现

Light-MER 通过 SWD-H 隐藏状态蒸馏和 M-GRPO 多奖励优化,将生成式多模态情感识别压到约 8.55 亿参数。论文在九个公开数据集上测试,平均表现超过 80 亿参数教师模型;参数量与 FLOPs 约降 11 倍,峰值显存降至 2.54GB。

来源:新智元

LiveEdit 用 4 步去噪把流式视频编辑推进到 12.66 FPS

清华大学与香港科技大学团队提出 LiveEdit,通过三阶段蒸馏把扩散推理从 100 步压到 4 步,并用掩码缓存复用未编辑区域的特征。系统处理 81 帧视频总延迟为 7.89 秒,达到 12.66 FPS;论文代码和模型已开放。

来源:机器之心

Frontis-MA1 在 MLE-Bench Lite 获得 71.21% 奖牌均值

Frontis-MA1 是一个面向机器学习工程的 350 亿参数元进化 Agent,训练于开放的递归自改进系统 OpenMLE。正式材料称,它在 MLE-Bench Lite 达到 71.21% 奖牌均值,超过 GPT-5.5 与 Codex,并提供论文、代码和数据集合入口。

来源:HuggingPapers

真实 V8 漏洞环境让安全 Agent 用确定性判分

卡内基梅隆大学教授、Bugcrowd 首席 AI 与科学官 David Brumley 介绍了一套可复现的强化学习安全环境:判分器直接检查利用是否触发指定漏洞,不让模型自行宣称成功。测试覆盖 41 个真实 V8 漏洞,最强模型约达 95%,并在困难样本中生成了真实沙箱逃逸利用和一个零日漏洞。

来源:AI Engineer

infini-gram 追踪 AI 文本与既有语料的逐字重合

Allen Institute for AI 介绍 infini-gram:系统索引大规模公开文本,统计任意长度短语的出现位置与频次,用来补足普通 AI 写作检测器无法给出来源的问题。研究者在各 200 本自出版书样本中发现,检测到大量 AI 文本的书里,稀有重合短语占 41.6%;对照组为 37.2%。

来源:Allen Institute for AI

💰 资管与金融科技前沿

温州把数据安全、产权、知识产权和资产凭证合并办理

温州推出数据要素“四证同办”,将安全合规评审证、数据产权证、数据知识产权证和数据资产证串进同一流程。当地由司法、财政、市场监管、数据等 10 余个部门组成工作组,每月集中评审数据项目;数安港已吸引超过 1200 家数据生态企业入驻。

来源:中国青年网

🔧 硬件算力与智能设备

澜起科技量产 CXL 3.2 芯片,传输速率最高 64 GT/s

中国芯片厂商澜起科技开始量产 CXL 3.2 芯片。正式材料披露,芯片最高数据传输速率为 64 GT/s,并集成双 DDR5 控制器,面向处理器与内存之间的高速互连需求。

来源:Tech in Asia

学术集群近两成 GPU 执行时间耗在等待

一项针对 756 块 GPU、持续 31 天的细粒度遥测发现,集群约 20% 的执行时间和 11% 的能耗消耗在同步、数据搬运等等待状态。材料还显示,Azure Code 与 Chat 类推理负载的空转能耗分别达到 65% 和 52%,说明高 GPU 利用率并不等于高有效吞吐。

来源:钛媒体


图文卡片 ⬇️ 一键下载图文卡片