🖼️ 图文卡片
FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-08-01

欧盟把通用 AI 与合成内容透明度规则推入执行阶段;Kimi K3 在 ARC-AGI-2 验证评测中拿到 60.4%;真实机器实验室测试显示,当前智能体无需人工修复即可执行的工作流仅占 3.3%。

资料提供:前沿科技研究部
降低FOMO的每日信息交付

2026-08-01 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

欧盟开始执行通用 AI 模型与合成内容透明度规则

欧盟委员会宣布,自 8 月 2 日起扩大《人工智能法》适用范围。聊天机器人须明确告知用户其 AI 身份,AI 生成或修改的图像、视频和音频须标识并带机器可读标记;欧洲人工智能办公室也可开始执行针对通用 AI 模型提供商的规则。招聘、教育、执法和移民等高风险系统的规则则推迟到 2027 年 12 月,嵌入医疗器械、机械等产品的相关规则推迟到 2028 年 8 月。

来源:华尔街见闻全球

Kimi K3 成为 ARC-AGI-1 与 ARC-AGI-2 最高分开放权重模型

ARC Prize 的验证结果显示,Kimi K3 在 ARC-AGI-2 得分 60.4%,单题成本 1.59 美元;在 ARC-AGI-1 得分 94.5%,单题成本 0.77 美元。它是该机构目前在两项评测中得分最高的开放权重模型,ARC-AGI-2 表现与两个月前发布的 Opus 4.8 low 档相当。

来源:ARC Prize

机器实验室压力测试:智能体可直接执行的工作流仅占 3.3%

中国科大团队把 6 种智能体框架与 9 种大模型组合成 48 种配置,在含 45 个自动工作站的催化实验室完成 4,608 次测试。只有 151 个工作流无需人工修复即可执行,占 3.3%;最佳的 Claude Code 与 Claude Opus 4.7 组合达到 28.1%,Codex 与 GPT-5.5 组合为 19.8%。

来源:新智元

同一模型换智能体框架,Token 消耗最多相差 30 倍

Composio 用 Kimi K3 在 Claude Code、Hermes 和 Kimi Code 三套框架上运行 28 个相同任务,成功数分别为 20、21 和 22。成功率接近,但单任务 Token 消耗最高相差 30 倍;中位数分别约为 34 万、6.7 万和 6.1 万,Claude Code 的中位耗时也最长。

来源:AI提效手册

Google 上线一天后撤回地球 AI 生图功能

Google Earth 接入 Nano Banana 2 后,用户可以按提示在真实卫星地图上叠加生成图像。功能上线一天即被撤回,因为生成截图可能被当作地理证据传播;Google 表示,部分分享内容疑似违反政策,将在加入更强防护后再处理该功能。

来源:TechCrunch

OpenAI 向高校研究者开放一整套科研工作区

OpenAI 推出 ChatGPT for Academic Researchers,今夏先提供 1 万个名额,目标是在 2027 年覆盖 10 万名高校科研人员,每人免费使用 12 个月。计划包含 ChatGPT、ChatGPT Work、Codex、扩容版 Deep Research、科研连接器和 75 个以上生命科学技能,但不含 API 额度,也不开放模型权重。

来源:BAAI 智源


🔥 今日聚合动态

DeepSeek V4 Flash 只改后训练,智能体得分与成本曲线同时前移

DeepSeek V4 Flash 0731 保持 284B 总参数、13B 激活参数、100 万 Token 上下文和原有价格,更新重点落在后训练。Artificial Analysis 的独立评测显示,其 Intelligence Index 从 40 升至 50,并进入智能水平与单任务成本的帕累托前沿;另一条材料确认模型权重、技术报告与 MIT 许可证已经发布。

视角来源核心信息
独立评测Artificial AnalysisGDPval-AA v2 Elo 从 1189 升至 1559,Terminal-Bench 2.1 上升 17 个百分点至 79%,运行整套评测的输出 Token 还减少 12%。
开放发布kimmonismus正式版维持相同架构,并发布权重、技术报告和 MIT 许可证;其激活参数量远小于 Pro 预览版。

MiniMax H3 把多模态视频生成、局部编辑和开放权重放进同一产品

MiniMax 发布 H3,并通过首批合作伙伴提供服务,模型权重承诺随后开放。官方信息给出原生立体声和多参考输入范围;两组媒体实测则把焦点放在商业视频的文字保持、局部替换、多轮编辑与交付成本上。

视角来源核心信息
官方能力MiniMaxH3 可组合最多 9 张图片、3 段视频和 3 段音频,并在生成中保持主体、运动与音频一致。
工作流实测APPSO七张产品截图可直接生成宣传片;模型支持物体与背景替换,但小而密集的文字仍会偶发乱码。
成本与边界Z Potentials2K 每秒价格低于 Seedance 的三分之一;实测中口型覆盖多数发音,但投放素材仍需人工审校。

📰 独立报道

🤖 AGI 前沿

PyTorch 2.13 将 FlexAttention 带到 Apple Silicon

PyTorch 2.13 支持在 Apple Silicon 上使用 FlexAttention,并以 nn.LinearCrossEntropyLoss 将大词表模型的峰值内存最多降低 4 倍。在受测稀疏配置中,按掩码模式专门编译的内核相对 SDPA 最多加速约 12 倍,CUDA 反向路径还增加了确定性选项。

来源:PyTorch

Spatial-IQ 把三维物体计数拆成九类空间推理任务

NVIDIA Research 发布 Spatial-IQ:人类在含遮挡方块的计数任务上准确率为 82.1%,最佳现成多模态模型仅为 17.7%。按九类感知与认知子任务训练后,Qwen2.5-VL-32B 的物体计数准确率从 2.9% 升至 62.6%,论文、数据集和代码均已开放。

来源:NVIDIA AI

视觉提示工程让视频模型先“看懂”再推理

Google DeepMind 的 VIPE 方法先改写视觉输入,同时保留物体数量、位置和关系,再交给视频模型推理。在 VPCT 物理任务上,Veo 3.1 准确率从 41.3% 升至 59.3%;继续多次采样可达 68.0%。方法依赖编辑器不篡改任务信息,原生图像生成模型也未出现稳定收益。

来源:BAAI 智源

INTACT 让世界模型直接从意图生成动作

浙大、清华等团队提出无搜索控制方法 INTACT,把局部状态变化与未来目标映射到同一动作算子。模型只训练 1 个 epoch,在四项 LeWM 任务上平均成功率 95.33%;必要时加入小规模验证可达 96.86%,规划延迟从 1.48 秒降至最低 2.9 毫秒。

来源:AI提效手册

Seedance 2.5 支持 30 秒原生视频和 50 个多模态参考

字节跳动在即梦上线 Seedance 2.5,支持 30 秒原生视频直出、最多 50 个多模态参考,以及绿幕、白模输入。实测中,模型能够复刻白模的空间结构和镜头运动,并在文具广告的动态转换中基本保持文字一致;结果仍来自特定案例,不等同于通用成功率。

来源:十字路口 Crossing

Decagon 把大部分企业智能体推理迁到开源模型

Decagon 两位联合创始人在访谈中披露,公司已将大部分推理迁到开源模型,并围绕延迟、评测和微调构建生产系统。其经验是,企业智能体落地还需要前线工程、业务流程接入和持续评测,单纯调用前沿模型不足以支撑客服、销售与运营自动化。

来源:a16z Podcast

无可验证答案的强化学习,把环境当作奖励锚点

Prime Intellect 的 Will Brown 介绍了面向开放任务的强化学习路线:用真实文档和代码库生成有依据的问答,或先隐藏漏洞、后让模型找回,以此构造难度可调的奖励。该方法仍需检查完整轨迹和小规模实验,因为奖励漏洞会让模型学会绕过目标。

来源:AI Engineer

💰 资管与金融科技前沿

九方智投用实体对齐和交叉校验约束投顾智能体

九方智投发布 AI 股票机智航版,底层由自研金融模型、智能体框架、金融数据底座和合规风控平台组成。数据侧使用金融实体对齐、多源事实交叉校验、脱敏清洗和标注质检;模型侧把资源集中在贴近投顾场景与合规要求的后训练,并要求输出有依据、推理可追溯。

来源:中国基金报

🎓 学术前沿

AgentHOI 无需专项标注训练即可识别人和物的交互

北大团队提出 AgentHOI,把人—物交互检测拆成多模态语义推理与 GroundingDINO 空间定位。系统通过三轮推理补找遗漏交互,再结合动作、位置和外观描述消除多人多物场景歧义;整个流程不在 HOI 数据上更新参数,代码与模型已经开放。

来源:机器之心

Hyra 提出可无限扩展的加法组合构造并由 Lean 4 验证

腾讯科研智能体 Hyra 先把有限集合结果从约 1.14 提高到 1.21,随后提出十二进制结构、循环群对称加法基与中国剩余定理结合的参数化构造。研究人员整理证明并用 Lean 4 形式化验证,证明指标 C(A) 可无限接近理论上界 2;论文仍是预印本,尚未同行评议。

来源:智东西

量星-QAdapt 用神经预解码适配不同量子芯片噪声

中科量枢发布量子纠错模型 QAdapt,在经典解码器前先处理时空错误信号。其 HTNet 参数量比 Ising-fast 少 28.75%,在 110 种新噪声配置中全部胜出;未经重新训练迁移到 Google Willow 数据后,d=5 和 d=7 的逻辑错误率分别下降约 5.8% 和 2.5%。

来源:DeepTech 深科技


图文卡片 ⬇️ 一键下载图文卡片