前沿科技日报 · 2026-08-01
欧盟把通用 AI 与合成内容透明度规则推入执行阶段;Kimi K3 在 ARC-AGI-2 验证评测中拿到 60.4%;真实机器实验室测试显示,当前智能体无需人工修复即可执行的工作流仅占 3.3%。
2026-08-01 前沿科技洞见 · 日报
📊 今日关键数据
- 60.4% / 1.59 美元:Kimi K3 在 ARC-AGI-2 验证评测中的得分与单题成本(来源:ARC Prize)
- 3.3%:中国科大机器实验室 4,608 次测试中,无需人工修复即可执行的智能体工作流占比(来源:新智元)
- 30 倍:Composio 在相同模型、相同任务条件下测得的三套智能体框架最大 Token 消耗差距(来源:AI提效手册)
- 10 分:DeepSeek V4 Flash 0731 的 Artificial Analysis Intelligence Index 相比前版提升幅度,从 40 升至 50(来源:Artificial Analysis)
- 82.1% 对 17.7%:Spatial-IQ 遮挡物体计数中,人类与最佳现成多模态模型的准确率对比(来源:NVIDIA AI)
- 10 万人 / 12 个月:OpenAI 计划到 2027 年覆盖的高校科研人员规模及免费使用期(来源:BAAI 智源)
🔍 今日值得深读
欧盟开始执行通用 AI 模型与合成内容透明度规则
欧盟委员会宣布,自 8 月 2 日起扩大《人工智能法》适用范围。聊天机器人须明确告知用户其 AI 身份,AI 生成或修改的图像、视频和音频须标识并带机器可读标记;欧洲人工智能办公室也可开始执行针对通用 AI 模型提供商的规则。招聘、教育、执法和移民等高风险系统的规则则推迟到 2027 年 12 月,嵌入医疗器械、机械等产品的相关规则推迟到 2028 年 8 月。
- 关键变化:透明度义务和通用模型规则进入执行阶段,系统性风险模型还需防范网络攻击、模型失控和有害操纵等大规模危害。
- 为什么值得深读:模型提供商、内容平台和采用 AI 的企业需要同时处理用户提示、内容标记、风险管理与审计记录,合规要求开始落到产品接口和运营流程。
- 后续看点:欧洲人工智能办公室如何认定具有系统性风险的通用模型,以及延期的高风险系统规则在 2027 年前如何调整。
来源:华尔街见闻全球
Kimi K3 成为 ARC-AGI-1 与 ARC-AGI-2 最高分开放权重模型
ARC Prize 的验证结果显示,Kimi K3 在 ARC-AGI-2 得分 60.4%,单题成本 1.59 美元;在 ARC-AGI-1 得分 94.5%,单题成本 0.77 美元。它是该机构目前在两项评测中得分最高的开放权重模型,ARC-AGI-2 表现与两个月前发布的 Opus 4.8 low 档相当。
- 关键变化:开放权重模型在抽象推理评测上逼近近期闭源旗舰,同时公开了单题成本和可复现入口。
- 为什么值得深读:模型能力、开放方式和推理成本可以在同一套验证框架里比较,这比只看厂商自报榜单更接近部署决策。
- 后续看点:ARC Prize 已开始运行 Kimi K3 的 ARC-AGI-3 评测,结果将检验它在更强调交互与适应的新任务上能否延续优势。
来源:ARC Prize
机器实验室压力测试:智能体可直接执行的工作流仅占 3.3%
中国科大团队把 6 种智能体框架与 9 种大模型组合成 48 种配置,在含 45 个自动工作站的催化实验室完成 4,608 次测试。只有 151 个工作流无需人工修复即可执行,占 3.3%;最佳的 Claude Code 与 Claude Opus 4.7 组合达到 28.1%,Codex 与 GPT-5.5 组合为 19.8%。
- 关键变化:评测从生成实验计划推进到真实设备可执行性,并追踪规划、核验、下发和反馈后的重新规划。
- 为什么值得深读:语言上合理的方案常无法直接驱动机器;长链路中遗漏试剂、设备约束和步骤依赖,才是自主实验的实际瓶颈。
- 后续看点:后续系统能否突破局部参数调整,在实验失败后重写工作流骨架,并提高超过 30 步任务的稳定执行比例。
来源:新智元
同一模型换智能体框架,Token 消耗最多相差 30 倍
Composio 用 Kimi K3 在 Claude Code、Hermes 和 Kimi Code 三套框架上运行 28 个相同任务,成功数分别为 20、21 和 22。成功率接近,但单任务 Token 消耗最高相差 30 倍;中位数分别约为 34 万、6.7 万和 6.1 万,Claude Code 的中位耗时也最长。
- 关键变化:差异主要来自多轮交互中反复送回消息、工具调用、命令输出和文件内容,而非模型输出变长。
- 为什么值得深读:智能体成本不能只按模型单价估算,编排层的上下文管理、重试和工具轨迹会直接改变账单与延迟。
- 后续看点:现有智能体基准是否会加入框架层 Token、延迟和任务成本指标,并在更大任务集上复现这一差距。
来源:AI提效手册
Google 上线一天后撤回地球 AI 生图功能
Google Earth 接入 Nano Banana 2 后,用户可以按提示在真实卫星地图上叠加生成图像。功能上线一天即被撤回,因为生成截图可能被当作地理证据传播;Google 表示,部分分享内容疑似违反政策,将在加入更强防护后再处理该功能。
- 关键变化:生成式编辑进入具有证据属性的地图产品后,风险不再局限于单张假图,还会借用平台原有的可信外观。
- 为什么值得深读:新闻、研究和应急响应依赖卫星图像判断地点与事件,产品内生成功能会抬高来源验证和标记要求。
- 后续看点:Google 会采用何种水印、界面隔离或导出限制,以及这些防护能否保留地理专业用户的创作场景。
来源:TechCrunch
OpenAI 向高校研究者开放一整套科研工作区
OpenAI 推出 ChatGPT for Academic Researchers,今夏先提供 1 万个名额,目标是在 2027 年覆盖 10 万名高校科研人员,每人免费使用 12 个月。计划包含 ChatGPT、ChatGPT Work、Codex、扩容版 Deep Research、科研连接器和 75 个以上生命科学技能,但不含 API 额度,也不开放模型权重。
- 关键变化:免费计划覆盖文献、代码、数据分析、形式化验证和写作,不再只是单一模型的聊天入口。
- 为什么值得深读:科研机构会更快遇到工作流绑定、数据权限、结果复现和工具退出成本问题,尤其是在免费期结束之后。
- 后续看点:首批 1 万名研究者如何使用连接器和生命科学技能,以及一年后能否迁移完整项目记录与审计轨迹。
来源:BAAI 智源
🔥 今日聚合动态
DeepSeek V4 Flash 只改后训练,智能体得分与成本曲线同时前移
DeepSeek V4 Flash 0731 保持 284B 总参数、13B 激活参数、100 万 Token 上下文和原有价格,更新重点落在后训练。Artificial Analysis 的独立评测显示,其 Intelligence Index 从 40 升至 50,并进入智能水平与单任务成本的帕累托前沿;另一条材料确认模型权重、技术报告与 MIT 许可证已经发布。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 独立评测 | Artificial Analysis | GDPval-AA v2 Elo 从 1189 升至 1559,Terminal-Bench 2.1 上升 17 个百分点至 79%,运行整套评测的输出 Token 还减少 12%。 |
| 开放发布 | kimmonismus | 正式版维持相同架构,并发布权重、技术报告和 MIT 许可证;其激活参数量远小于 Pro 预览版。 |
- 互补信息:发布信息回答“是否可拿到和部署”,独立评测补上“能力提升发生在哪些任务、付出多少推理成本”。
- 后续看点:开放权重部署能否复现第一方 API 的缓存折扣和 Token 效率,以及 84% 的幻觉率在后续版本能否继续下降。
MiniMax H3 把多模态视频生成、局部编辑和开放权重放进同一产品
MiniMax 发布 H3,并通过首批合作伙伴提供服务,模型权重承诺随后开放。官方信息给出原生立体声和多参考输入范围;两组媒体实测则把焦点放在商业视频的文字保持、局部替换、多轮编辑与交付成本上。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 官方能力 | MiniMax | H3 可组合最多 9 张图片、3 段视频和 3 段音频,并在生成中保持主体、运动与音频一致。 |
| 工作流实测 | APPSO | 七张产品截图可直接生成宣传片;模型支持物体与背景替换,但小而密集的文字仍会偶发乱码。 |
| 成本与边界 | Z Potentials | 2K 每秒价格低于 Seedance 的三分之一;实测中口型覆盖多数发音,但投放素材仍需人工审校。 |
- 互补信息:官方材料界定输入能力和开放计划,两组实测补上成片质量、编辑稳定性、定价与仍需人工处理的环节。
- 后续看点:承诺的模型权重何时发布,私有化部署能否保持在线服务的多模态控制与 2K 生成成本。
📰 独立报道
🤖 AGI 前沿
PyTorch 2.13 将 FlexAttention 带到 Apple Silicon
PyTorch 2.13 支持在 Apple Silicon 上使用 FlexAttention,并以 nn.LinearCrossEntropyLoss 将大词表模型的峰值内存最多降低 4 倍。在受测稀疏配置中,按掩码模式专门编译的内核相对 SDPA 最多加速约 12 倍,CUDA 反向路径还增加了确定性选项。
来源:PyTorch
Spatial-IQ 把三维物体计数拆成九类空间推理任务
NVIDIA Research 发布 Spatial-IQ:人类在含遮挡方块的计数任务上准确率为 82.1%,最佳现成多模态模型仅为 17.7%。按九类感知与认知子任务训练后,Qwen2.5-VL-32B 的物体计数准确率从 2.9% 升至 62.6%,论文、数据集和代码均已开放。
来源:NVIDIA AI
视觉提示工程让视频模型先“看懂”再推理
Google DeepMind 的 VIPE 方法先改写视觉输入,同时保留物体数量、位置和关系,再交给视频模型推理。在 VPCT 物理任务上,Veo 3.1 准确率从 41.3% 升至 59.3%;继续多次采样可达 68.0%。方法依赖编辑器不篡改任务信息,原生图像生成模型也未出现稳定收益。
来源:BAAI 智源
INTACT 让世界模型直接从意图生成动作
浙大、清华等团队提出无搜索控制方法 INTACT,把局部状态变化与未来目标映射到同一动作算子。模型只训练 1 个 epoch,在四项 LeWM 任务上平均成功率 95.33%;必要时加入小规模验证可达 96.86%,规划延迟从 1.48 秒降至最低 2.9 毫秒。
来源:AI提效手册
Seedance 2.5 支持 30 秒原生视频和 50 个多模态参考
字节跳动在即梦上线 Seedance 2.5,支持 30 秒原生视频直出、最多 50 个多模态参考,以及绿幕、白模输入。实测中,模型能够复刻白模的空间结构和镜头运动,并在文具广告的动态转换中基本保持文字一致;结果仍来自特定案例,不等同于通用成功率。
Decagon 把大部分企业智能体推理迁到开源模型
Decagon 两位联合创始人在访谈中披露,公司已将大部分推理迁到开源模型,并围绕延迟、评测和微调构建生产系统。其经验是,企业智能体落地还需要前线工程、业务流程接入和持续评测,单纯调用前沿模型不足以支撑客服、销售与运营自动化。
来源:a16z Podcast
无可验证答案的强化学习,把环境当作奖励锚点
Prime Intellect 的 Will Brown 介绍了面向开放任务的强化学习路线:用真实文档和代码库生成有依据的问答,或先隐藏漏洞、后让模型找回,以此构造难度可调的奖励。该方法仍需检查完整轨迹和小规模实验,因为奖励漏洞会让模型学会绕过目标。
来源:AI Engineer
💰 资管与金融科技前沿
九方智投用实体对齐和交叉校验约束投顾智能体
九方智投发布 AI 股票机智航版,底层由自研金融模型、智能体框架、金融数据底座和合规风控平台组成。数据侧使用金融实体对齐、多源事实交叉校验、脱敏清洗和标注质检;模型侧把资源集中在贴近投顾场景与合规要求的后训练,并要求输出有依据、推理可追溯。
来源:中国基金报
🎓 学术前沿
AgentHOI 无需专项标注训练即可识别人和物的交互
北大团队提出 AgentHOI,把人—物交互检测拆成多模态语义推理与 GroundingDINO 空间定位。系统通过三轮推理补找遗漏交互,再结合动作、位置和外观描述消除多人多物场景歧义;整个流程不在 HOI 数据上更新参数,代码与模型已经开放。
来源:机器之心
Hyra 提出可无限扩展的加法组合构造并由 Lean 4 验证
腾讯科研智能体 Hyra 先把有限集合结果从约 1.14 提高到 1.21,随后提出十二进制结构、循环群对称加法基与中国剩余定理结合的参数化构造。研究人员整理证明并用 Lean 4 形式化验证,证明指标 C(A) 可无限接近理论上界 2;论文仍是预印本,尚未同行评议。
来源:智东西
量星-QAdapt 用神经预解码适配不同量子芯片噪声
中科量枢发布量子纠错模型 QAdapt,在经典解码器前先处理时空错误信号。其 HTNet 参数量比 Ising-fast 少 28.75%,在 110 种新噪声配置中全部胜出;未经重新训练迁移到 Google Willow 数据后,d=5 和 d=7 的逻辑错误率分别下降约 5.8% 和 2.5%。
来源:DeepTech 深科技