FINTECH FRONTIER DAILY
🏠 返回首页
FINTECH FRONTIER DAILY

前沿科技日报 · 2026-08-21

DeepSeek Harness v0.1.0-rc.8 把 Claude Code、Codex 纳为子代理并开始原生“看图”;英伟达 Spectrum-X CPO 交换机进入全面量产;Gemini 3.7 Flash 以 84.6% 的 ARC-AGI-2 成绩验证低成本高分路线。

降低FOMO的每日信息交付

2026-08-21 前沿科技洞见 · 日报


📊 今日关键数据


🔍 今日值得深读

DeepSeek Harness v0.1.0-rc.8:Claude Code、Codex 成子代理,模型适配器开始“看图”

DeepSeek Harness 发布 v0.1.0-rc.8 预发布版本。DeepSeek 模型适配器开始接收图片,Claude Code 和 Codex 可以作为子代理按需安装,web_search 支持并发查询,Windows 端加入持久 PowerShell 会话。新版本同时修复大图请求失败、流式生成上下文断裂等问题,并优化 SQLite 性能;Codex 子代理还支持非交互式权限模式和多个命名实例。

来源:APPSO


MiniMax 把 H3 与 Agent 绑成 MiniMax Design,做视频领域的“Claude Code”

MiniMax H3 在 Artificial Analysis 视频编辑榜排第一,文生视频、图生视频也进入全球前三。H3 采用 H3-Context-IR、330 亿参数 H3-Base、H3-Regenerate-2K 三段式架构,定价约为同级别产品三分之一。MiniMax 随后把 Hub 升级为 MiniMax Design,用 Agent 承接提示词、风格一致性和后期修改。

来源:极客公园


Rootly 废止小 PR 规则,AI 代码评审改为评估“爆炸半径”

Rootly 宣布放弃沿用两年的小型拉取请求规则。公司认为 AI 智能体以“特性”为单位生成完整实现,旧规则反而增加跨 PR 评审负担。Rootly 改由内部 AI 审查器按风险评分输出结构化报告,并用特性开关把安全边界从合并阶段移到渐进式发布阶段。

来源:AI前线


Jeff Dean 离职后首谈:TensorFlow 有过两个失误,新公司要做科学自动化

在斯坦福 2026 Frontier & Pioneer Symposium 上,Jeff Dean 承认 Gemini 早期对 Coding 能力重视偏晚,TensorFlow 早期缺少 Eager Execution、contrib 目录造成社区混乱。他披露新公司 Discovery Loop 将押注 AI 驱动的科学发现,目标把实验迭代从周级压缩到小时级,并做覆盖参数、数据、Eval 和架构的递归自我改进。

来源:量子位


DeepMind 提出 Recirculation:不改权重,让深层激活回流浅层

DeepMind 在冻结权重的 Gemma3 上加入一条跨层回路,把较深层的激活重新注入浅层,并增加一个小型 MLP 逐维预测回流系数。9 个语言建模数据集平均困惑度下降 23.0%,略高于全量微调的 21.6%;在 Qwen3、Pythia 等五个模型家族也找到有效源层—目标层组合。

来源:PaperWeekly


🔥 今日聚合动态

英伟达 CPO 交换机量产,SK 海力士同步押注光互连

英伟达 Spectrum-X CPO 交换机进入全面量产,SK 海力士同一天释出 CPO 技术路线图,两家公司都把光互连作为下一代 AI 基础设施的共同答案。一条来源给出产品落地参数,另一条给出供应链和出货量预测。

视角来源核心信息
产品落地虎嗅英伟达 8 月 14 日宣布 SpectrumX Ethernet Photonics 全面量产,全球首款 200G/lane CPO 交换机,功耗效率提升 5 倍
市场与供应链广发香港预计 2026 年英伟达 Scale-out CPO 交换机出货约 1.5 万台,2027 年提升至 10 万台;光引擎 2028 年或达 1900 万个

📰 独立报道

🤖 AGI 前沿

ARC Prize 公布 Gemini 3.7 Flash 成绩:ARC-AGI-2 达 84.6%

ARC Prize 发布 Gemini 3.7 Flash 验证成绩:ARC-AGI-2 为 84.6%,每题 0.25 美元;ARC-AGI-1 为 95.5%,每题 0.12 美元。官方称其相对其他前沿模型以更低成本拿到高分,并正在运行 ARC-AGI-3 评测。

来源:ARC Prize


Grok 4.6 在 Artificial Analysis Agentic Index 并列第一

Grok 4.6(high)在 Artificial Analysis Agentic Index 得分 59,与 Claude Opus 5(max)并列第一,超过 Claude Fable 5 和 GPT-5.6 Sol。Elon Musk 称 Grok Build、Grok Bot 需要模型实际调用工具、完成工作,该成绩对 agentic 场景更有参考价值。

来源:Elon Musk


Meta 预览 WildArtifactBench,用偏好裁判评估多模态智能体

Meta 预览内部评估框架 WildArtifactBench,用人类和智能体偏好裁判的胜率与 Elo 分替代固定真值评分,覆盖多模态智能体在真实任务和多种交付物上的表现,并先公开其中 10 个任务。

来源:AI at Meta


百度文心助手发布任务引擎 2.0,高阶 Agent 能力免费开放

百度文心助手发布任务引擎 2.0,免费开放 Office 办公、研究、数据清洗等任务能力;搜索推出 GUI 交互式答案,已上线 2326 个组件。实测 4 张截图 2 分半生成规范 Excel,整理出 86 条记录、覆盖 38 所学校。

来源:量子位


阿里发布 AI 音乐模型快乐虾米,一句话生成歌曲

阿里 8 月 17 日发布 AI 音乐模型 HappyShrimp 1.0“快乐虾米”,支持一句话生成歌曲,标准会员约 30 元/月生成 150 首。横评显示其中文情感共情强于 Suno,但 Suno 在工作流、声音克隆和定制模型上仍有优势。

来源:人人都是产品经理


Composio 横评五款编程 Agent:Pi 通过率最高,DeepSeek 最省钱

Composio 用 DeepSeek-V4-Pro 跑 30 个多应用集成任务,对比 Claude Code、Pi、OpenCode、Hermes、DeepSeek Harness。Pi 通过 21 题最高,DeepSeek Harness 通过 20 题且单题成本 0.028 美元最低,Claude Code 平均 181.8 秒最快。

来源:AI信息Gap


Braintrust:Agent 架构升级后,评测要跟上一同迁移

Braintrust 的 Ameya Bhatawdekar 认为智能体评测必须随架构演进而变:pass@k 只测能力,多次尝试成功率才测可靠性;同一输入在可靠循环下每次轨迹不同,单次评测结果不再足够。他提出评测资产应跨平台保留,并从生产数据持续更新。

来源:AI Engineer · 视频


🏢 AI 战略与组织变革

阿里云 AI 收入进入利润释放期,自研芯片覆盖 650 家客户

阿里云第一财季外部商业化收入同比增 45%,AI 相关产品收入 123.76 亿元、连续 12 个季度三位数增长;AI 云与算力业务经调整 EBITDA 利润率升至 12%。平头哥真武 M890 已覆盖超 650 家外部客户,超节点实例可运行超 2 万亿参数模型推理。

来源:华尔街见闻


Callosum 与 Cerebras 合作,用软硬件协同路由降低 AI 算力成本

英国 AI 初创 Callosum 与 Cerebras 合作,通过软硬件协同把特定 AI 任务路由到合适模型与芯片,降低算力成本。公司已与 Rebellions、Axelera AI 签约,英国主权 AI 基金参与本轮,是其成立以来披露的首笔投资。

来源:财联社AI daily


Datawhale 对谈 Google 开发者生态总监:Agent 的价值不是加速旧流程

Datawhale 与 Google 全球开发者生态总监 David McLaughlin 对谈。McLaughlin 认为 Agent 的价值不只是让原有流程更快,而应重新设计业务;中国开发者的优势在速度和创新,但出海需要本地数据规则与商业环境经验。

来源:Datawhale


⛓️ 区块链创新

Thunes 用稳定币做跨境预付和全球 payout

Thunes 产品负责人 Pritpal Shokar 在 Stablecoin Stories 介绍,Thunes 用稳定币做跨境预付和全球 payout,以实时结算替代传统金融报文链路,并讨论合规、链上 FX 与未来机器支付场景。

来源:Tokenized · 视频


💰 资管与金融科技前沿

PwC 与 NAB 谈受监管金融机构的 Agent 规模化治理

PwC 与 NAB 在 AWS FSI Sydney 讨论受监管金融机构如何把 AI Agent 规模化投入生产:挑战从“构建”转向“治理”,需要在 Agent 生命周期内嵌入信任、问责和可观测性,让每个 Agent 保持 owned、controlled、behaving as intended。

来源:AWS Events · 视频


Techcom Life 以 AI-first 架构成立寿险公司,四个月成越南银保第一

Techcombank 旗下 Techcom Life 2025 年在 AWS 上以云原生、AI-first 架构成立寿险公司,2026 年前四个月成为越南银行保险渠道第一。CIOO 分享其从第一天绕过传统系统约束的落地方式。

来源:AWS Events · 视频


日本最大信托银行把文化建成安全控制,Mythos 漏洞响应以周计

三井住友信托银行 CISO 在 AWS FSI Sydney 介绍,银行向 1,900 多名工程师推广领导力准则,并把几乎所有安全应用整合到 AWS。在金融机构应对 Mythos 级漏洞时,该行以周级速度完成响应。

来源:AWS Events · 视频


🎓 学术前沿

OmniShow 以极简干预统一多模态视频生成,入选 ICML 2026

港中文、字节、莫纳什、港大联合提出 OmniShow,在 12.3B 的 Waver 1.0 上同时处理文本、参考图、音频和 pose,仅新增 2.5% 参数,实现多模态可控视频生成,已被 ICML 2026 接收。

来源:PaperWeekly


🔧 硬件算力与智能设备

PyTorch 与 IBM Spyre 用 AI coding agent 补齐新加速器软件栈

PyTorch 发布 IBM Spyre 团队技术博客:AI coding agent 为 torch-spyre 编写运行时适配器,13 个 AI 生成适配器让前 1 万个 HuggingFace embedding 模型中的 7,960 个可运行,6,804 个通过端到端设备测试。

来源:PyTorch