前沿科技日报 · 2026-08-06
Meta 用可持续运行的子智能体切入长周期编程,Fable 5 把 ARC-AGI-2 成绩推至 89.2%,MAGI-2 则用 114B 总参数、约 6B 激活参数压低视频生成计算量。
2026-08-06 前沿科技洞见 · 日报
📊 今日关键数据
- 89.2%、5.45 美元/题:Fable 5 在 ARC-AGI-2 的经验证得分与单题成本;其 ARC-AGI-1 得分为 98.5%(来源:ARC Prize)
- 114B / 约 6B:MAGI-2-preview 的总参数与单次前向激活参数规模(来源:量子位)
- 约 1,815.75 枚 BTC、5,294 个地址:Coldcard 事件四轮疑似攻击的链上特征汇总,尚不能视为逐一确认的受害地址或最终损失(来源:吴说Real)
- 30% / 70%:QBench 理论轨道与工程轨道在综合成绩中的权重(来源:QuantML)
- 超过 1,000 次工具调用、最长 24 小时:Muse Code 长周期 GPU 内核优化压力测试的规模(来源:Meta AI)
- 超过 15GW:SemiAnalysis 跟踪到未配置柴油发电机、中央 UPS 或两者均未配置的数据中心容量(来源:SemiAnalysis)
🔍 今日值得深读
Meta 发布 Muse Code,以持久子智能体处理长周期软件工程
Meta 推出终端编程智能体 Muse Code 测试版,并同步发布协同训练的 Muse Spark 1.2。系统可规划、实施和验证大型代码库中的多文件修改;后台子智能体跨会话持续工作,追加式本地事件日志记录模型调用、工具运行、审批和编辑,使任务可精确回放并在中断后恢复。
- 关键事实:Meta 称其压力测试持续最多 24 小时、调用工具超过 1,000 次,用于迭代优化 Hopper GPU 上的内核。
- 为什么值得深读:这里的变化不只在模型,而在运行时如何保存状态、并行推进子任务并留下完整审计轨迹。
- 后续看点:Muse Code 扩大开放后,长周期内核优化结果能否由外部开发者复现,以及零数据留存申请如何落地。
来源:Meta AI
Fable 5 在 ARC-AGI-2 得分 89.2%,单题成本 5.45 美元
ARC Prize 公布经验证的 Fable 5 结果:ARC-AGI-1 得分 98.5%,单题成本 1.02 美元;ARC-AGI-2 得分 89.2%,单题成本 5.45 美元。由于该模型不支持零数据留存,ARC Prize 改用 Anthropic 的 Compliance API 监测评测数据是否被人工查看,并称目前没有测试触发人工审查。
- 关键事实:Fable 5 是 ARC Prize 迄今在 ARC-AGI-1 上评测得分最高的模型。
- 为什么值得深读:高分之外,这次评测把数据是否暴露给开发者纳入可审计流程,直接关系到榜单结果能否被信任。
- 后续看点:ARC Prize 已在运行 ARC-AGI-3 评测,后续结果将检验该模型在更难任务上的表现与成本。
来源:ARC Prize
MAGI-2 用细粒度 MoE 扩大视频模型,单次仅激活约 6B 参数
Sand.ai 开源 MAGI-2-preview。模型总参数 114B,单次前向计算激活约 6B,并把文本、视频和音频放入同一个 Transformer 联合建模。其 Multi-Head LatentMoE 将 3,072 维隐藏表示拆成 12 个子空间独立路由,再用 Head Parallel 把跨设备通信移到动态路由之前。
- 关键事实:模型在 36 层主体网络的每层设置 3,072 个专家单元,每个 token 合计激活 72 个小专家;配套 MagiMoE 内核库融合路由、排序与专家计算。
- 为什么值得深读:视频序列远长于文本,通信和显存搬运会先于矩阵计算成为瓶颈;MAGI-2 给出了一套针对视频 MoE 的系统解法。
- 后续看点:公开代码与权重能否让外部团队复现其音画同步效果、榜单成绩和实际生成成本。
来源:量子位
Coldcard 随机数路径错误波及旧助记词,升级固件仍不足以消除风险
Coldcard 在 2021 年迁移代码时,部分固件把钱包种子生成接入软件伪随机数生成器,而非预期的硬件随机数生成器。链上特征分析将四轮疑似攻击合计到约 1,815.75 枚 BTC、5,294 个地址,但这些地址尚未逐一确认为 Coldcard 受害者;仅升级固件或把旧助记词导入其他钱包,无法补回已经缺失的随机性。
- 关键事实:风险取决于创建助记词时的设备与固件版本;用户需要在修复后的固件或其他可信环境中生成新种子并迁移资金。
- 为什么值得深读:这类缺陷发生在密钥生成源头,后续软件更新能修正代码,却不能修正已经生成的弱种子。
- 后续看点:Coinkite 是否进一步统一 Mk2、Mk3 的受影响版本口径,以及链上分析能否完成端到端攻击复现和受害地址确认。
来源:吴说Real
QBench 把量化模型评测拆成理论准入与工程交付
QuantML 发布并开源 QBench,用理论与工程两条轨道评测量化投资 LLM 和智能体。理论部分覆盖时点财务数据、交易成本、Purge 与 Embargo、组合风险和 Pandas 多资产标签等问题;工程部分要求模型在独立工作区完成因子实现、回测修复、组合风险、性能优化和产物审计。
- 关键事实:Theory Track 与 Engineering Track 均为 100 分,综合权重分别为 30% 和 70%;首轮只公布了理论测试结果。
- 为什么值得深读:量化研究中的数据泄漏、时间错位和回测契约错误,往往不会被通用金融问答基准识别。
- 后续看点:8 个独立会话和工作区中的工程测试结果公布后,理论满分模型能否在冷启动与隐藏案例中保持可靠。
来源:QuantML
🔥 今日聚合动态
Google DeepMind 调整领导层,Jeff Dean 团队创办 Discovery Loop
Demis Hassabis 转任 Google DeepMind 主席兼 Alphabet 首席科学家,把日常领导工作交给 Koray Kavukcuoglu;Jeff Dean 则与 Sanjay Ghemawat、Oriol Vinyals、Quoc Le 离开 Google,创办公共利益公司 Discovery Loop。两项动作都把科学研究自动化放到核心位置:Hassabis将更专注长期战略与 Isomorphic 的疾病研究,Discovery Loop 首个方向是自动化机器学习研究和工程的大规模实验循环。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| DeepMind 领导层 | Demis Hassabis | Hassabis 转任主席兼 Alphabet 首席科学家,Koray Kavukcuoglu 以高级副总裁身份领导 DeepMind。 |
| 新公司路线 | Jeff Dean | Discovery Loop 将先构建基础设施、模型和系统,用自身研发作为自动化实验循环的首批场景。 |
| 团队去向 | WIRED | 四位 Google 资深研究与工程负责人共同创业,目标覆盖药物发现、芯片设计等科学与工程问题。 |
- 互补信息:个人公告确认了职位、团队与首个技术方向,报道补充了团队离开 Google 后的应用范围。
- 后续看点:DeepMind 新管理层如何分配模型研发与科学项目资源,以及 Discovery Loop 首批自动化实验系统能否形成可验证成果。
📰 独立报道
🤖 AGI 前沿
SeedRealtime 把音频、视频与文本放进统一全双工模型
字节跳动发布原生音视频全双工模型 SeedRealtime,并在豆包 App 全量上线。模型可在连续多模态信息流上边看、边听、边说;端到端人工评测显示,相比级联系统,音视频对话节奏问题减少一半,抢断、迟回应和背景杂音误触发均有所减少。
来源:财联社 AI daily
Prime Agent 用可编程上下文支撑长任务
Prime Intellect 发布开源编程框架 Prime Agent。它把上下文作为可操作变量,只提供持久化 IPython 内核,让模型自行检索历史、调用工具、启动持久子智能体并把状态写到活动上下文之外;发布方称,搭配 Opus 5 时在 ARC-AGI-3 上得分 95.5%。
阿里 UEmbed 一次前向生成稠密与稀疏多模态表示
阿里在 Hugging Face 发布 UEmbed。这是一款仅解码器多模态嵌入模型,可在一次前向计算中,从文本、图像和视频输入同时生成稠密向量与稀疏词法表示,把语义召回和关键词匹配放进同一模型输出。
Kimi K3 用 LatentMoE 控制近千专家的通信开销
Kimi K3 的架构拆解显示,模型拥有 2.8 万亿总参数和 896 个路由专家,每个 token 只激活 16 个。LatentMoE 先把 7,168 维隐藏状态压到 3,584 维再送入专家,配合负载均衡与 KDA、Gated MLA 交替注意力,降低跨卡通信和长上下文计算成本。
来源:AI科技评论
🏢 AI 战略与组织变革
Anthropic 开始组建定制 AI 芯片团队
Anthropic 正招聘具备芯片设计经验的工程师,组建“custom silicon team”,计划协同设计硬件与模型,以提高 Claude 的运行速度和效率。公司目前通过 AWS、Google、Nvidia 和 AMD 获取算力;新团队意味着其开始把模型与硬件联合优化纳入内部能力。
来源:TechCrunch
影石把 Camera Agent 的交付目标定为自动成片
影石创始人刘靖康透露,公司正把影像设备从“相机”推进到 Cameraman,也就是自动完成拍摄和剪辑的 Camera Agent。其云端 AI 剪辑服务按每条 6 元收费,前两个月灰度测试完成数十万条剪辑,导出率超过 50%;当前限制包括云端异步生成和端侧算力不足。
来源:Founder Park
甲骨文把企业智能体接入统一数据与权限栈
甲骨文披露企业 AI 技术栈:以 Oracle AI Database 26ai 作为多模数据底座,向上提供 Agent Memory、Private Agent Factory、Select AI Agent 和 MCP 支持。安全侧把最终用户身份贯通到数据库行列权限,并将安全补丁频率从季度提高到每月。
来源:智东西
⛓️ 区块链创新
Cloudflare 为智能体加入身份与限额钱包
Cloudflare 发布 Cloudflare Wallets,让部署在其平台上的智能体在创建者设定的额度内购买在线服务。方案把 x402 付款条件放进 HTTP 请求,并以账户钱包管理资金、虚拟钱包隔离智能体预算;Wallet Handle 则为智能体提供可识别的支付身份。
来源:APPSO
💰 资管与金融科技前沿
TEI 用六级体系同时评估具身任务能力与物理安全
Xspark AI 联合多所高校提出 TEI T0—T5 六级可信分级,从任务能力、安全管控、系统兜底、证据充分性和部署治理五个维度评估具身系统。等级由最弱环节决定,并可随场景切换、模型漂移、监控故障或证据缺失实时下调。
来源:Z Potentials
🔧 硬件算力与智能设备
数千台服务器暴露 BMC 固件后门风险
研究人员披露,多家主流厂商的联网服务器可因主板管理控制器漏洞被远程植入后门,部分缺陷已存在十余年。BMC 拥有独立固件、网络栈和 IP,即使主机关闭也能重启、更新或重装系统,因此构成长期被忽视的带外管理攻击面。
来源:Ars Technica
15GW 以上在建数据中心削减传统备用电力
SemiAnalysis 称,其跟踪到超过 15GW 的数据中心容量没有柴油发电机、中央 UPS,或两者均未配置。原因包括训练任务可借助持续检查点容忍中断,以及取消备用系统可缩短许可、施工和调试周期;微软 Fairwater 的 GPU 大厅和 Anthropic 的设计也采用了类似取舍。
来源:SemiAnalysis(数据规模) · SemiAnalysis(工程取舍) · SemiAnalysis(部署案例)
西部数据把 AI 存储长协排到 2031 年
西部数据称,AI 推理、智能体与物理 AI 持续产生和保留数据,客户已开始讨论覆盖 2029—2031 年的硬盘长期协议。公司路线图包括 2027 年上半年出货 44TB HAMR 硬盘、下半年推出 50TB 产品,并预计每 TB 成本中期每年下降约 10%。
来源:华尔街见闻
D-Wave 验证双轨量子比特的纠缠能力
D-Wave 在 Nature 论文中展示双轨量子比特的关键验证:两个量子比特可以形成纠缠,同时保留其主要错误易于检测的特性。该公司原本以量子退火设备为主,收购 Quantum Circuits 后继续推进基于双轨量子比特的门型量子计算路线。
来源:Ars Technica