前沿科技日报 · 2026-08-21
DeepSeek Harness v0.1.0-rc.8 把 Claude Code、Codex 纳为子代理并开始原生“看图”;英伟达 Spectrum-X CPO 交换机进入全面量产;Gemini 3.7 Flash 以 84.6% 的 ARC-AGI-2 成绩验证低成本高分路线。
2026-08-21 前沿科技洞见 · 日报
📊 今日关键数据
- 84.6% / 0.25 美元:Gemini 3.7 Flash 在 ARC-AGI-2 的验证成绩和单任务成本,ARC-AGI-1 为 95.5%、0.12 美元(来源:ARC Prize)
- 59:Grok 4.6 在 Artificial Analysis Agentic Index 得分,与 Claude Opus 5 并列第一(来源:Elon Musk)
- 495 亿元 / 650 家:阿里 AI 相关产品年化收入突破 495 亿元;平头哥真武 M890 覆盖超 650 家外部客户(来源:华尔街见闻)
- 23.0%:DeepMind Recirculation 在 Gemma3 冻结权重下取得的平均困惑度降幅,略高于全量微调的 21.6%(来源:PaperWeekly)
- 0.028 美元:DeepSeek Harness 在 Composio 五款编程 Agent 横评中的单题平均成本,为最低(来源:AI信息Gap)
- 200G/lane / 5 倍:英伟达 Spectrum-X CPO 交换机单通道速率与网络功耗效率提升倍数(来源:虎嗅)
🔍 今日值得深读
DeepSeek Harness v0.1.0-rc.8:Claude Code、Codex 成子代理,模型适配器开始“看图”
DeepSeek Harness 发布 v0.1.0-rc.8 预发布版本。DeepSeek 模型适配器开始接收图片,Claude Code 和 Codex 可以作为子代理按需安装,web_search 支持并发查询,Windows 端加入持久 PowerShell 会话。新版本同时修复大图请求失败、流式生成上下文断裂等问题,并优化 SQLite 性能;Codex 子代理还支持非交互式权限模式和多个命名实例。
- 为什么值得深读:Agent 竞争正从模型能力扩展到执行环境的调度、状态管理和多智能体协作,Harness 在决定任务能否稳定完成。
- 后续看点:v0.1 正式版是否给出向后兼容和生产迁移路径;SQLite 旧数据升级能否平滑过渡。
来源:APPSO
MiniMax 把 H3 与 Agent 绑成 MiniMax Design,做视频领域的“Claude Code”
MiniMax H3 在 Artificial Analysis 视频编辑榜排第一,文生视频、图生视频也进入全球前三。H3 采用 H3-Context-IR、330 亿参数 H3-Base、H3-Regenerate-2K 三段式架构,定价约为同级别产品三分之一。MiniMax 随后把 Hub 升级为 MiniMax Design,用 Agent 承接提示词、风格一致性和后期修改。
- 为什么值得深读:视频生成竞争从单模型质量转向“模型 + Agent”工作流和批量交付能力,决定企业能否把生成质量变成稳定产能。
- 后续看点:内测结束后 MiniMax Design 是否开放企业级批量生产、风格锁定和可复用的后期工作流。
来源:极客公园
Rootly 废止小 PR 规则,AI 代码评审改为评估“爆炸半径”
Rootly 宣布放弃沿用两年的小型拉取请求规则。公司认为 AI 智能体以“特性”为单位生成完整实现,旧规则反而增加跨 PR 评审负担。Rootly 改由内部 AI 审查器按风险评分输出结构化报告,并用特性开关把安全边界从合并阶段移到渐进式发布阶段。
- 为什么值得深读:代码评审指标从行数转向影响范围,意味着工程流程需要随 AI 生成代码重新设计。
- 后续看点:Rootly 这套基于风险审查的模型能否在更多团队复现;Diff Vader 等工具是否会跟进同一思路。
来源:AI前线
Jeff Dean 离职后首谈:TensorFlow 有过两个失误,新公司要做科学自动化
在斯坦福 2026 Frontier & Pioneer Symposium 上,Jeff Dean 承认 Gemini 早期对 Coding 能力重视偏晚,TensorFlow 早期缺少 Eager Execution、contrib 目录造成社区混乱。他披露新公司 Discovery Loop 将押注 AI 驱动的科学发现,目标把实验迭代从周级压缩到小时级,并做覆盖参数、数据、Eval 和架构的递归自我改进。
- 为什么值得深读:这是一线负责人对大模型路线与科研自动化的具体复盘,解释了小团队为何能在前沿方向获得速度。
- 后续看点:Discovery Loop 是否发布首个可复现实验闭环;递归自我改进会先用于哪类科学任务。
来源:量子位
DeepMind 提出 Recirculation:不改权重,让深层激活回流浅层
DeepMind 在冻结权重的 Gemma3 上加入一条跨层回路,把较深层的激活重新注入浅层,并增加一个小型 MLP 逐维预测回流系数。9 个语言建模数据集平均困惑度下降 23.0%,略高于全量微调的 21.6%;在 Qwen3、Pythia 等五个模型家族也找到有效源层—目标层组合。
- 为什么值得深读:Transformer 的性能不只来自参数规模,状态传播方式本身仍有可挖掘空间。
- 后续看点:论文代码和权重开放后,能否在下游任务稳定复现;多轮回流是否会让系统表现出循环网络特性。
来源:PaperWeekly
🔥 今日聚合动态
英伟达 CPO 交换机量产,SK 海力士同步押注光互连
英伟达 Spectrum-X CPO 交换机进入全面量产,SK 海力士同一天释出 CPO 技术路线图,两家公司都把光互连作为下一代 AI 基础设施的共同答案。一条来源给出产品落地参数,另一条给出供应链和出货量预测。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 产品落地 | 虎嗅 | 英伟达 8 月 14 日宣布 SpectrumX Ethernet Photonics 全面量产,全球首款 200G/lane CPO 交换机,功耗效率提升 5 倍 |
| 市场与供应链 | 广发香港 | 预计 2026 年英伟达 Scale-out CPO 交换机出货约 1.5 万台,2027 年提升至 10 万台;光引擎 2028 年或达 1900 万个 |
- 互补信息:虎嗅给出 200G/lane、功耗效率等产品参数和 SK 海力士论文目标;广发香港给出 2026—2028 年出货量与光引擎需求预测。
- 后续看点:2027 年 CPO 交换机出货预测能否兑现;国内光模块厂商能否切入光引擎等高价值环节。
📰 独立报道
🤖 AGI 前沿
ARC Prize 公布 Gemini 3.7 Flash 成绩:ARC-AGI-2 达 84.6%
ARC Prize 发布 Gemini 3.7 Flash 验证成绩:ARC-AGI-2 为 84.6%,每题 0.25 美元;ARC-AGI-1 为 95.5%,每题 0.12 美元。官方称其相对其他前沿模型以更低成本拿到高分,并正在运行 ARC-AGI-3 评测。
来源:ARC Prize
Grok 4.6 在 Artificial Analysis Agentic Index 并列第一
Grok 4.6(high)在 Artificial Analysis Agentic Index 得分 59,与 Claude Opus 5(max)并列第一,超过 Claude Fable 5 和 GPT-5.6 Sol。Elon Musk 称 Grok Build、Grok Bot 需要模型实际调用工具、完成工作,该成绩对 agentic 场景更有参考价值。
来源:Elon Musk
Meta 预览 WildArtifactBench,用偏好裁判评估多模态智能体
Meta 预览内部评估框架 WildArtifactBench,用人类和智能体偏好裁判的胜率与 Elo 分替代固定真值评分,覆盖多模态智能体在真实任务和多种交付物上的表现,并先公开其中 10 个任务。
来源:AI at Meta
百度文心助手发布任务引擎 2.0,高阶 Agent 能力免费开放
百度文心助手发布任务引擎 2.0,免费开放 Office 办公、研究、数据清洗等任务能力;搜索推出 GUI 交互式答案,已上线 2326 个组件。实测 4 张截图 2 分半生成规范 Excel,整理出 86 条记录、覆盖 38 所学校。
来源:量子位
阿里发布 AI 音乐模型快乐虾米,一句话生成歌曲
阿里 8 月 17 日发布 AI 音乐模型 HappyShrimp 1.0“快乐虾米”,支持一句话生成歌曲,标准会员约 30 元/月生成 150 首。横评显示其中文情感共情强于 Suno,但 Suno 在工作流、声音克隆和定制模型上仍有优势。
来源:人人都是产品经理
Composio 横评五款编程 Agent:Pi 通过率最高,DeepSeek 最省钱
Composio 用 DeepSeek-V4-Pro 跑 30 个多应用集成任务,对比 Claude Code、Pi、OpenCode、Hermes、DeepSeek Harness。Pi 通过 21 题最高,DeepSeek Harness 通过 20 题且单题成本 0.028 美元最低,Claude Code 平均 181.8 秒最快。
来源:AI信息Gap
Braintrust:Agent 架构升级后,评测要跟上一同迁移
Braintrust 的 Ameya Bhatawdekar 认为智能体评测必须随架构演进而变:pass@k 只测能力,多次尝试成功率才测可靠性;同一输入在可靠循环下每次轨迹不同,单次评测结果不再足够。他提出评测资产应跨平台保留,并从生产数据持续更新。
来源:AI Engineer · 视频
🏢 AI 战略与组织变革
阿里云 AI 收入进入利润释放期,自研芯片覆盖 650 家客户
阿里云第一财季外部商业化收入同比增 45%,AI 相关产品收入 123.76 亿元、连续 12 个季度三位数增长;AI 云与算力业务经调整 EBITDA 利润率升至 12%。平头哥真武 M890 已覆盖超 650 家外部客户,超节点实例可运行超 2 万亿参数模型推理。
来源:华尔街见闻
Callosum 与 Cerebras 合作,用软硬件协同路由降低 AI 算力成本
英国 AI 初创 Callosum 与 Cerebras 合作,通过软硬件协同把特定 AI 任务路由到合适模型与芯片,降低算力成本。公司已与 Rebellions、Axelera AI 签约,英国主权 AI 基金参与本轮,是其成立以来披露的首笔投资。
来源:财联社AI daily
Datawhale 对谈 Google 开发者生态总监:Agent 的价值不是加速旧流程
Datawhale 与 Google 全球开发者生态总监 David McLaughlin 对谈。McLaughlin 认为 Agent 的价值不只是让原有流程更快,而应重新设计业务;中国开发者的优势在速度和创新,但出海需要本地数据规则与商业环境经验。
来源:Datawhale
⛓️ 区块链创新
Thunes 用稳定币做跨境预付和全球 payout
Thunes 产品负责人 Pritpal Shokar 在 Stablecoin Stories 介绍,Thunes 用稳定币做跨境预付和全球 payout,以实时结算替代传统金融报文链路,并讨论合规、链上 FX 与未来机器支付场景。
💰 资管与金融科技前沿
PwC 与 NAB 谈受监管金融机构的 Agent 规模化治理
PwC 与 NAB 在 AWS FSI Sydney 讨论受监管金融机构如何把 AI Agent 规模化投入生产:挑战从“构建”转向“治理”,需要在 Agent 生命周期内嵌入信任、问责和可观测性,让每个 Agent 保持 owned、controlled、behaving as intended。
来源:AWS Events · 视频
Techcom Life 以 AI-first 架构成立寿险公司,四个月成越南银保第一
Techcombank 旗下 Techcom Life 2025 年在 AWS 上以云原生、AI-first 架构成立寿险公司,2026 年前四个月成为越南银行保险渠道第一。CIOO 分享其从第一天绕过传统系统约束的落地方式。
来源:AWS Events · 视频
日本最大信托银行把文化建成安全控制,Mythos 漏洞响应以周计
三井住友信托银行 CISO 在 AWS FSI Sydney 介绍,银行向 1,900 多名工程师推广领导力准则,并把几乎所有安全应用整合到 AWS。在金融机构应对 Mythos 级漏洞时,该行以周级速度完成响应。
来源:AWS Events · 视频
🎓 学术前沿
OmniShow 以极简干预统一多模态视频生成,入选 ICML 2026
港中文、字节、莫纳什、港大联合提出 OmniShow,在 12.3B 的 Waver 1.0 上同时处理文本、参考图、音频和 pose,仅新增 2.5% 参数,实现多模态可控视频生成,已被 ICML 2026 接收。
来源:PaperWeekly
🔧 硬件算力与智能设备
PyTorch 与 IBM Spyre 用 AI coding agent 补齐新加速器软件栈
PyTorch 发布 IBM Spyre 团队技术博客:AI coding agent 为 torch-spyre 编写运行时适配器,13 个 AI 生成适配器让前 1 万个 HuggingFace embedding 模型中的 7,960 个可运行,6,804 个通过端到端设备测试。
来源:PyTorch