前沿科技日报 · 2026-08-18
CoreWeave 用 8,192 张 NVIDIA GB300 NVL72 把 DeepSeek-V3 671B 训练跑进 2.02 分钟;Deno 发布 MIT 许可的 Claw Patrol,在 Agent 外拦截越权字节;Cursor 推出代码托管平台 Origin,把 PR 审查转向 Agent 高频工作流。
2026-08-18 前沿科技洞见 · 日报
📊 今日关键数据
- 2.02 分钟:CoreWeave 在 MLPerf Training v6.0 中用 8,192 张 GB300 NVL72 训练 DeepSeek-V3 671B,为该轮最快结果(来源:CoreWeave)
- 97%:Towards AI 实测中完整上下文有 97% token 命中 prompt cache,是“不压缩更便宜”的关键原因(来源:AI Engineer)
- 1400 万笔:过去 30 天 x402 转账几乎全部通过 USDC 完成,Agent 支付集中在单一稳定币(来源:Token Terminal)
- 4 亿欧元:Circle 的 EURC 流通量突破 4 亿欧元,过去一年供应增长超过 100%(来源:Circle)
- 每小时 29.6 万次 clone:Cursor Origin 宣称支持 Agent 级高频代码操作,单仓库每秒 22 次 commit,全球同步延迟低于 400ms(来源:AGI Hunt)
🔍 今日值得深读
CoreWeave 用 8,192 张 GB300 NVL72 把 DeepSeek-V3 671B 训练跑进 2.02 分钟
CoreWeave 在 MLPerf Training v6.0 中用 8,192 张 NVIDIA GB300 NVL72 GPU 完成 DeepSeek-V3 671B 训练,耗时 2.02 分钟,为该轮基准最快结果;其白皮书公开了成绩背后的集群工程。这个数字把前沿级稠密模型的全量训练时间压到分钟级,但前提是数千卡级互联、专用冷却和通信架构已经就位。
- 为什么值得深读:它把 MLPerf 结果从单卡跑分变成可核算的集群工程指标,训练时间、卡数和互联规模被直接绑定在一起。
- 后续看点:CoreWeave 白皮书是否披露流水线、存储与网络配置;同套 GB300 NVL72 集群在其他大模型上能否保持同一量级。
来源:CoreWeave
Deno 发布 Claw Patrol:在 Agent 外解析每个字节,拦下越权操作
Deno 已让事故响应 Agent 读写生产 Postgres、Kubernetes、ClickHouse、AWS、GitHub 和 Slack,这些 Agent 现在能关闭过去需要人工处理的故障。Ryan Dahl 随后发布 MIT 许可的 Claw Patrol 代理,放在 Agent 之前解析每个输出字节,能在 HTTP 层以下拦截 psql 直连生产库等危险路径;凭证保存在代理侧,Agent 看不到,HCL 规则可以把操作路由给 LLM 裁判、Slack 人工或两者。
- 为什么值得深读:它把 Agent 安全从模型服从和工具权限表下沉到进程与线协议检查,正面回应 prompt injection 和内部越权。
- 后续看点:Claw Patrol 规则和 fixture 测试是否公开;Deno 会否把更多生产恢复权限交回给自动 Agent 并由代理兜底。
来源:AI Engineer · 视频
Towards AI 实测:不压缩上下文反而更便宜,完整历史召回 95%
Towards AI 团队在 11 组预设配置下测试开源 AI tutor,发现最便宜、延迟最低的选项是把完整上下文原样发送,不压缩胜过所有摘要技术。原因是 97% token 走 prompt cache,缓存 token 在部分 API 上便宜最高约 50 倍;摘要重写会清空缓存,必须把上下文缩小 50 倍以上才划算。同一测试中,完整历史对具体细节的召回为 95%,摘要只有 32%;但本地 32k 窗口下,dense retrieval 对埋在 40 万 token 处的事实召回为 0,BM25 仍全部命中。
- 为什么值得深读:它推翻“压缩上下文一定省钱”的默认工程假设,并把结论绑定在缓存计费、窗口上限和检索器特性上。
- 后续看点:在自建推理栈和不同缓存价格下,盈亏平衡点会如何变化;长会话生产系统是否需要在窗口耗尽前提前切换检索而不是默认压缩。
来源:AI Engineer · 视频
字节 Seed 明确不蒸馏别人模型,同时承担 Coding 线更慢的代价
张一鸣在 7 月底 Seed 内部会议上明确,字节大模型即使暂时落后,也不把蒸馏其他模型输出当成提升能力的捷径;这一原则从 Seed 成立时已定下,字节近期还成立一级部门“AI 数据与安全”。智能涌现复盘称,Seed-2.1 Pro 在 Code Arena WebDev 总榜排第 16,落后于 Kimi K3 和 GLM-5.2;不蒸馏会拖慢 Coding 和 Agent 线,但 Seedance 视频生成线已在不用外部模型蒸馏的情况下进入全球前列。
- 为什么值得深读:它把“是否蒸馏”从训练技巧变成路线选择,并关联到数据飞轮、美国监管点名和 TikTok 业务约束。
- 后续看点:字节五万亿参数超大模型能否跑通不蒸馏的原生预训练;Seed 在 Coding 和 Agent 线是否能在不蒸馏前提下缩短差距。
来源:智能涌现
OVOW:从一段单目视频重建可进入物理引擎的 4D 世界
清华大学、中国科学技术大学、SparcAI 等团队提出 OVOW(One Video, One World),已被 ECCV 2026 接收。它从普通单目视频出发,把场景拆成实例、补全几何、恢复尺度与运动,再修正地面、重力、悬浮和穿透,输出可碰撞、可编辑的实例级 4D Mesh;刚体和非刚体用同一套表示处理,系统串联视觉基础模型,无需另训专用大模型。
- 为什么值得深读:它把机器人 Real2Sim 的数据来源从专用扫描设备降到普通视频,重建结果能直接送进物理引擎产生新的交互轨迹。
- 后续看点:开源代码后,策略在 OVOW 仿真中的表现能否迁移到真机;团队是否发布更大规模的视频-物理场景数据。
来源:AI提效手册
🔥 今日聚合动态
珍本书被追踪进亚马逊 AI 训练设施并遭破坏性扫描
404 Media 用 AirTag 追踪一批匿名大宗购书,最终证明书被送到亚马逊位于拉斯维加斯的 AI 训练设施 VGT3 区域;三个来源分别补上现场细节、追踪方法和训练数据动因。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 现场追踪 | Ars Technica | AirTag 被送到亚马逊 LAS8 设施 VGT3,门口标志显示团队做破坏性扫描;亚马逊回应未提及 AI 训练。 |
| 调查还原 | Simon Willison | 书商接到约 1000 本大宗订单,按 404 Media 安排放入 AirTag,最终确认送到 VGT3。 |
| 训练数据动因 | TechCrunch | 珍本书对 LLM 训练价值高,因为公开网页上的数据已被模型消化。 |
- 互补信息:Ars 补上亚马逊回应,Simon Willison 把假说变成可验证追踪,TechCrunch 解释为什么模型需要这批书。
- 后续看点:亚马逊是否会公开扫描与保留政策;Biblio 等书商平台是否限制不明去向的大宗采购。
Cursor 上线代码托管平台 Origin,接住 Agent 高频提交场景
Cursor 官方宣布 Origin 开始向所有付费用户推送早期 Beta,定位为 Agent 规模的 Git 托管;官方公告、社区拆解和中文评测共同说明它不只是代码存储,而是同步、PR、AI 审查与部署的整套工作流。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 官方公告 | Techmeme | Origin 在付费计划上推出早期 Beta,支持仓库、PR 和 GitHub 同步。 |
| 功能拆解 | X · kimmonismus | Origin 支持仓库托管、PR 管理、AI 代码审查,并接入 Vercel 部署;可双向同步 GitHub。 |
| 性能与时机 | AGI Hunt | GitHub 宕机后 Cursor 发布 Origin;平台宣称每小时 29.6 万次 clone、单仓库每秒 22 次 commit、全球同步延迟低于 400ms。 |
- 互补信息:官方公告确认开放范围,社区号补充功能边界,AGI Hunt 补上性能数据和 GitHub 宕机背景。
- 后续看点:正式版是否继续保留 GitHub 双向同步;SpaceX 收购后的 Agent 生态会否把 Origin 变成执行层。
📰 独立报道
🤖 AGI 前沿
Codex 开放 GPT-5.6 Sol 的 1M 上下文窗口
Codex 开放 GPT-5.6 Sol 的 100 万 token 上下文窗口,用户在 config.toml 中把 model_context_window 设为 1000000 即可启用,也可单会话临时试用;官方提示默认窗口已做过性能与成本调优。
来源:多来源综合
Groq 从 AI 芯片转向 neocloud:54MW 明年扩至 200MW 以上
Groq 宣布 3.5 亿美元 A 轮融资,计划参与方包括 Nvidia;资金用于把现有机房规模从 54MW 扩展到明年的 200MW 以上,向客户提供中大型 Nvidia 加速计算集群。官方称已有超过 600 万开发者和数千家 AI 原生公司使用其服务,每周生成数万亿 token。
来源:Groq
Google 以 1000 万美元赢得 Spirit Airlines 破产拍卖数据
Google LLC 在破产拍卖中以 1000 万美元中标,获得 Spirit Airlines 的去标识化业务数据、软件代码和运营记录,用于改进 AI 模型。
来源:Techmeme
Aviator:超过 30% 代码变更已在无人审查下合并
Aviator 创始人 Ankit Jain 在 AI Engineer 分享的数据显示,超过 30% 的代码变更现在没有人工审查就合并,被审查变更的等待时间是过去的四倍。他提出把开发会话中的决策转成验收标准,并由验证系统对实时预览生成测试计划,让审查对象从 diff 转向意图和证据。
来源:AI Engineer · 视频
Yutori 用 RL 浏览器模型把 Agent 跑上生产规模
Yutori 的浏览器 Agent 分为 24/7 监控网页的 Scouts 和跨应用处理任务的 Delegate,底层是强化学习训练的 Navigator 浏览器使用模型。其在生产中的推理负载短输出、长输入且延迟模式分裂,Together AI 平台将推理速度提高到 2 倍,成本降到约四分之一至五分之一。
来源:Together AI · 视频
npm 上线分阶段发布,软件包上架前新增人工审核
npm 正式上线分阶段发布功能,软件包上架前新增人工审核环节。该变化直接改变开源 JavaScript 包进入分发渠道前的中间步骤。
来源:InfoQ 中文站
⛓️ 区块链创新
x402 近 30 天转账几乎全部用 USDC,达到 1400 万笔
Token Terminal 数据显示,过去 30 天 x402 转账的 1400 万笔中几乎全部使用 USDC,Circle 支付在 Agent 支付协议中占据事实主导地位。AI Agent 之间高频、跨境、任意金额的支付被认为扩大了稳定币的可服务市场。
🔧 硬件算力与智能设备
SemiAnalysis:Google TPUv9 或维持双轨,训练版引入 6D Torus
SemiAnalysis 称,传闻指向 Google TPUv9 继续双轨:推理专用芯片 TPUv9i 转向新版 Boardfly,训练专用 TPUv9t 则用 3D Torus 的演进版本 6D Torus。TPUv8t 的 3D Torus 已把 scale-up 域扩展到最多 9,600 颗互联芯片,6D Torus 会进一步改变 ICI 网络拓扑。
来源:SemiAnalysis
SemiAnalysis:6D Torus 把 4096 芯片最坏跳数从 24 降至 12
SemiAnalysis 的网络模型显示,4096 芯片集群在 16×16×16 的 3D Torus 下最坏需要 24 跳,而 4⁶ 的 6D Torus 把最坏跳数降到 12,平分带宽也会增加,代价是显著更多的光模块和 OCS 容量。
来源:SemiAnalysis
SemiAnalysis:苹果 N2 迁移速度是 N3 和 N5 的 1.5 倍
SemiAnalysis 更新的 Apple Foundry Model 估算,苹果在 2026 年第三季度率先导入台积电 N2,迁移速度是此前 N3 和 N5 时的 1.5 倍,即使 N2 晶圆初始价格比 N3 高出近 50%。模型预计苹果在 2026-2027 年约占台积电 N2 一半产出,而 N3 份额会从 2026 年初的过半降到 2027 年底的不足 10%。
来源:SemiAnalysis