前沿科技日报 · 2026-06-22
Gemini 3.5 Pro 难产暴露模型迭代瓶颈,Loop Engineering 重塑 AI 编程范式,SpatialClaw 突破 VLM 空间推理
2026-06-22 前沿科技洞见 · 日报
📊 今日关键数据
- 11.2 个百分点:英伟达 SpatialClaw 在 20 个空间推理 benchmark 上平均准确率超越 SpaceTools 的幅度(来源:人人都是产品经理)
- 98%:VisualClaw 通过级联编码门将流式视频处理 API 成本降低的比例(来源:学术头条-公众号)
- 10%:阿里妈妈 AIGB-Pearl 生成式出价算法在全站推场景落地后 GMV 提升幅度(来源:量子位-公众号)
- 145 小时:Physical Atari 系统机械手自主学习 Atari 游戏累计无人工干预运行时长(来源:机器之心-公众号)
- 60%:LLM-based Agent 在动态环境中因单步误差累积导致的决策链性能最高下降幅度(来源:机器之心-公众号)
🔍 今日值得深读
谷歌 CEO 亲口承认 Gemini 编程落后,模型迭代撞上“边际效应递减”深水区
就在谷歌即将发布 Gemini 3.5 Pro 之际,内部爆料和 CEO 皮查伊的公开表态,共同勾勒出一幅令人不安的图景:新模型不仅定价更高、内容过滤更严,而且在 AI 编程这一关键战场,已经被 OpenAI 和 Anthropic 拉开差距。皮查伊坦承“在 Agentic Coding 方面确实落后了”,而内部员工则用大量反 AI 表情包嘲讽公司自研编程工具 Jetski 制造“垃圾代码”。
问题的核心不是谷歌缺乏技术储备,而是 Gemini 系列长期存在的“懒惰”顽疾——在面对长文本和高复杂度任务时,模型倾向于消极怠工,输出毫无价值的回应,甚至在 AI 编辑器中未经用户同意就自动重写代码。这种在真实开发场景中反复出现的“不靠谱”行为,比任何 benchmark 分数的差距都更能说明问题。
这一事件标志着整个 AGI 行业正式迈入“边际效应递减”的深水区。靠堆砌参数和算力实现指数级跨越的黄金时代正在远去,随之而来的是昂贵的算力成本、越来越窄的安全红线,以及模型自身在物理极限下的自我妥协。对金融科技行业而言,这意味着依赖单一闭源模型的风险进一步上升——如果连谷歌都无法保证旗舰模型在编程任务上的稳定性,企业级 AI 应用的技术选型将更加倾向于“多模型路由”和“开源备份”策略。
- 关键事实:谷歌 CEO 皮查伊承认在 Agentic Coding 领域落后于 OpenAI 和 Anthropic,Gemini 3.5 Pro 被曝定价更高、内容过滤更严,模型在长文本和高复杂度任务中仍存在“懒惰”顽疾
- 为什么值得深读:谷歌作为全栈 AI 玩家,其旗舰模型暴露出的问题,揭示了整个行业在 Scaling Law 边际效益递减后,模型能力提升正从“参数竞赛”转向“工程优化”的范式转移
- 后续看点:Gemini 3.5 Pro 正式发布后的编程能力实测表现;谷歌是否会在 2026 年 Q3 调整定价策略或推出专门的编程优化版本以缩小差距
来源:BAAI 智源
“机器学习之父” Jordan 万字访谈:AGI 只是公关词,Hinton 等人的末日预言正在伤害年轻一代
在 MLST 播客的深度访谈中,统计机器学习奠基人 Michael I. Jordan 系统性地批评了当前 AI 行业的“公关化”倾向。他直言 AGI 是“扭曲研究路径的公关术语”,而 Hinton 等“思想领袖”从研究者转型为末日预言家,正在对年轻一代造成伤害——让他们误以为 AI 的核心问题是“如何控制超级智能”,而忽视了 AI 需要解决的真实社会问题。
Jordan 提出了一个更务实的框架:AI 应结合计算机科学、统计学和经济学,从集体主义视角设计“数据市场”和“价值创造机制”。他尖锐地指出,硅谷的思维方式是“人类是智能的,大脑是计算机,模仿它放大它,好事就会自然发生”——这种思维停在了这里,没有回答“这对谁有价值、以什么方式产生价值”等根本问题。
对于金融科技行业,Jordan 的批评具有直接映射意义。当前金融机构在 AI 应用中面临的最大困难,恰恰不是模型能力不足,而是不知道如何将 AI 嵌入到已有的业务流程、风险控制和合规体系中,并形成可审计、可追溯的决策闭环。Jordan 强调的“不确定性量化”和“集体主义经济学”,正是金融 AI 落地最需要的理论基础。
- 关键事实:Jordan 批评 AGI 是公关词,LLM 对自身不确定性一无所知,硅谷缺乏深度思考;他提出 AI 应从集体主义经济学视角出发,关注价值创造与分配
- 为什么值得深读:这不是一篇“AI 威胁论”或“AI 无用论”的站队文章,而是来自机器学习奠基人的系统性反思,直接挑战了当前主导 AI 叙事的“超级智能”框架,为 AI 治理和产业落地提供了不同的思想坐标
- 后续看点:Jordan 的集体主义 AI 经济学框架是否会催生新的数据市场或 AI 合规工具;金融监管机构是否会参考这一框架制定 AI 应用指南
来源:机器之心
英伟达 SpatialClaw 靠一个“持久化 Python 内核”让 VLM 空间推理准确率飙升 11 个百分点
英伟达发布的 SpatialClaw 框架,在 20 个空间推理 benchmark 上取得 59.9% 的平均准确率,比此前最强框架 SpaceTools 高出 11.2 个百分点。但真正值得关注的不是分数本身,而是它实现突破的方式:给 VLM 装了一个持久化的 Python 内核,让模型在推理时写代码、看结果、改代码、再看结果,直到自己满意为止。
这个看似简单的改动,实际上暴露了当前 AI 交互设计的一个致命盲区——工具之间无法“对话”。传统方案中,模型调用 SAM 3 分割后拿到的掩码是黑箱,无法做进一步几何计算;而 SpatialClaw 的持久化内核将所有输出留在内存中,模型可以随时用 NumPy、SciPy 对上一轮结果做任意分析。这种“边做边看”的闭环,是 AI 从“回答问题”走向“在真实世界中稳定做事”的关键一步。
该框架跨越了 6 个不同型号的 VLM 骨架和 20 个 benchmark,全部一致地变好,说明它解决的不是某个具体技术问题,而是所有 VLM 与工具交互时共同面临的结构性限制。对于金融科技场景中需要精确空间推理的任务——如保险理赔中建筑结构分析、供应链金融中仓储空间评估——这类“把工具连起来让 AI 自己验证”的设计思路,比单纯提升模型参数更有落地价值。
- 关键事实:SpatialClaw 在 20 个 benchmark 上平均准确率 59.9%,比 SpaceTools 高 11.2 个百分点;提升来自给 VLM 持久化 Python 内核,而非增大模型或训练数据
- 为什么值得深读:它揭示了 AI 交互设计的下一阶段方向——不是造更强的工具,而是让模型能自由使用工具并根据结果自主调整,这是从“执行固定任务”到“解决开放问题”的质变
- 后续看点:这套框架能否在金融风控、医学影像分析等需要精确空间推理的垂直场景中验证;英伟达是否会将类似设计理念集成到 CUDA 工具链中
来源:人人都是产品经理
扩散模型推理加速新范式:西湖大学固定预算 + 离线搜索,让缓存策略从“启发式”走向“最优化”
西湖大学 AGI 实验室提出 BudCache,一种扩散模型 step-level cache 的新方法。与现有依赖运行时阈值临时决定是否缓存的方法不同,BudCache 先固定推理预算,再通过模拟退火 + 爬山算法离线搜索出该预算下最优的缓存策略。这一改变让推理成本变得可控,同时更好地保留了生成质量。
BudCache 的核心贡献在于重新定义了问题本身:step-level cache 的关键不是“当前步骤能不能缓存”,而是“在固定预算下,哪些步骤最值得计算”。它不再依赖单步的局部误差信号,而是直接考察最终生成结果是否接近完整计算的结果。这种从“局部贪心”到“全局搜索”的转向,让扩散模型在 FLUX、Wan 等主流生成模型上,无需重新训练即可实现即插即用的加速。
对于需要大规模部署 AI 生成内容的企业——如金融行业的智能投顾报告生成、营销素材自动化生产——BudCache 提供了一种“先定预算再优化”的实用思路。这意味着 AI 应用的成本控制可以从“事后统计”转向“事前规划”,这对在预算约束下推进 AI 落地的金融科技团队来说,具有直接的工程参考价值。
- 关键事实:BudCache 将扩散模型缓存决策表述为预算约束下的离散优化问题,通过模拟退火 + 爬山算法离线搜索最优缓存策略,无需重新训练模型
- 为什么值得深读:它将推理成本控制从“被动接受”变为“主动规划”,这种“先定预算再优化”的模式,代表了 AI 应用工程化的重要方向——从追求最强能力,转向在给定成本约束下追求最优能力
- 后续看点:BudCache 在 Wan 视频生成模型上的实际部署效果;是否有进一步压缩到 5 步以内计算的极端预算场景测试
来源:量子位
🔥 今日聚合动态
从“提示词工程”到“循环工程”:AI 编程范式正在经历结构性转变
Claude Code 之父 Boris Cherny 公开表示“我已经不再直接提示 Claude,我的工作是写 loops”,引爆了“Loop Engineering”这一概念。Datawhale、人人都是产品经理、智能体 AI 等多方迅速跟进,从实操手册、架构拆解到风险警示,形成了对 AI 编程下一阶段的立体讨论。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 实操指南 | Datawhale | 公开 14 步 Loop Engineering 构建手册,综合 Anthropic 工程文档和实测数据,详述五大核心构件:Automations、Worktrees、Skills、Connectors、Sub-agents |
| 概念解析 | 人人都是产品经理 | 深度解析六大核心模块与三个实战场景,强调 Loop 的本质是“开发者从提示者变为系统设计者”,必须有明确的停止条件 |
| 风险警示 | 智能体AI-公众号 | 警告没有外部反驳机制的循环可能导致 AI 无限重复错误,Ralph Wiggum Loop 案例揭示循环需可信外部检查避免灾难 |
- 关键事实:Boris Cherny 公开表示不再直接提示 AI 而是写 loops;Loop Engineering 概念由开发者 Peter Steinberger 首次提出,Google 工程师 Addy Osmani 将其系统化命名
- 互补信息:Datawhale 从工程实操角度给出 14 步构建方案,人人都是产品经理从概念架构角度拆解六大模块,智能体 AI 从安全角度警示无反驳机制的循环可能导致灾难
- 后续看点:Anthropic 是否会在 Claude Code 产品中原生集成 Loop Engineering 设计模式;开源社区是否会涌现出标准化的 Loop 框架
强化学习后训练算法路线之争:从 PPO 的历史地位到 GRPO 的“过时”争议
一天之内,PPO 算法被 NeurIPS 拒稿的往事被重新提起,智谱 GLM-5.2 则宣布放弃 GRPO 转向 PPO,ICML 2026 又收录了揭示 RL 后训练导致模型探索能力坍缩的研究。三件事放在一起看,指向同一个核心问题:大模型后训练阶段的算法选择,正在从“跟着开源社区走”转向“任务导向的精细化设计”。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 历史反思 | 机器之心-公众号 | PPO 算法曾因“不够新颖”被 NIPS 2017 拒稿,但其影响力远超预期,折射出学术评价与产业需求间的错位 |
| 算法选择 | AI提效手册 | 智谱 GLM-5.2 放弃 GRPO 转向基于价值网络的 PPO,原因在于长程智能体任务轨迹长短不一,GRPO 的组内比较难以适用 |
| 核心问题 | 机器之心-公众号 | ICML 2026 研究发现 RL 后训练使大模型最后一层输出熵被压扁,导致探索新解能力坍缩;LED 方法通过聚合中间层早退概率恢复探索上限 |
- 关键事实:GLM-5.2 在长程强化学习阶段放弃 GRPO,重新引入价值网络;ICML 2026 研究揭示 RL 后训练导致模型探索能力下降,LED 方法在 5 个模型 6 个基准上将 pass@1 和 pass@16 平均提升 0.61 和 1.03 个百分点
- 互补信息:PPO 被拒稿的往事说明“有用”不等于“新颖”,GLM-5.2 的算法选择说明“长程任务”和“短程任务”需要不同的 RL 策略,LED 的发现则揭示了 RL 后训练在提升模型信心的同时可能牺牲探索能力
- 后续看点:PPO 是否会在更多开源大模型后训练中重新成为主流;LED 方法能否在金融风控等需要“探索多样性”的场景中验证
📰 独立报道
🤖 AGI 前沿
强化学习之父 Sutton 联手毁灭战士之父 Carmack:让机器人进入真实世界打游戏
John Carmack 与 Richard S. Sutton 团队发布 Physical Atari 系统,让机械手通过“看屏幕、动摇杆”自主学习 Atari 游戏,累计运行 145 小时无人工干预。该系统的成本低于 1000 美元,可连续运转数周,旨在解决 AI 在模拟器里训练与真实世界部署之间的巨大鸿沟。实验发现,即使同款机器人,策略在“陌生身体”上表现也明显更差,揭示了从虚拟到现实迁移的结构性难题。
- 关键事实:Physical Atari 系统成本低于 1000 美元,145 小时无人工干预运行;同款机器人策略迁移后表现明显下降
- 后续看点:Physical Atari 的训练方法能否迁移到工业机器人部署场景,缩短从仿真到真实产线的适配周期
来源:机器之心-公众号
OpenAI Codex 不再独宠 GPT:开放模型接入层,支持本地开源模型
OpenAI 的编程智能体 Codex 开放了模型接入层,允许开发者配置多个模型提供方,通过 --oss 参数可直接连接本地 Ollama 和 LM Studio 服务,这意味着 Codex 不再被 GPT 独占。此举被外界解读为 OpenAI 的“最开放一次”,允许用户通过开源模型降低成本并在本地运行以保护隐私,但接入的模型仍需兼容 Responses API 或通过路由层转换。
- 关键事实:Codex 开放模型接入层,支持连接本地开源模型;接入模型需兼容 Responses API 或通过路由层转换
- 后续看点:Codex 的开放策略是否会影响 GitHub Copilot 的技术路线;开源模型在 Codex 工作流中的实际表现能否达到 GPT 同等水平
来源:新智元-公众号
世界模型补上 LLM 推理短板:让 Agent 在动态环境中边执行边预判
现有 CoT、ToT 等推理方法主要在文本空间优化推理路径,但未显式建模环境状态转移。在网页交互等动态任务中,单步误差可能沿决策链逐级累积,模型性能下降最高达 60%。世界模型通过建模动作与状态变化的映射关系,为 LLM-based Agent 提供执行前预判后果的能力,有望解决动态环境中的决策失效问题。
- 关键事实:动态环境中单步误差可导致决策链性能下降最高 60%;世界模型让 Agent 具备执行前预判后果能力
- 后续看点:世界模型与 LLM 的集成方式是否能在金融交易模拟等动态场景中验证
来源:机器之心-公众号
VisualClaw 让流式视频 Agent 成本降低 98%,还能自进化
研究团队提出自进化多模态 Agent VisualClaw,通过级联编码门在设备端筛选视频帧,减少云端上传帧数,将流式视频处理的 API 成本平均降低 98%。同时,模型能根据失败案例更新 skill 库,避免其不断膨胀,实现持续自进化。这套方案为 AI 眼镜等可穿戴设备提供了可用的“视觉大脑”。
- 关键事实:VisualClaw 通过级联编码门将视频处理 API 成本平均降低 98%;支持根据失败案例更新 skill 库实现自进化
- 后续看点:VisualClaw 能否在金融合规审查中的实时视频监控场景中部署
来源:学术头条-公众号
阿里妈妈&清华提出生成式出价新算法 AIGB-Pearl,获 ICLR 2026 Oral
阿里妈妈与清华大学合作提出 AIGB-Pearl,通过强化学习后训练机制构建“生成-评估-优化”闭环,引入 Lipschitz 连续性与 KL 散度双重约束,解决初代 AIGB 模型的“开环”决策问题。该算法已在阿里妈妈全站推场景落地,GMV 提升 10%。对于金融科技领域的实时竞价(如量化交易做市商报价),这种闭环优化的 RL 框架具有直接映射价值。
- 关键事实:AIGB-Pearl 引入双重约束提升训练鲁棒性,已在阿里妈妈落地,GMV 提升 10%
- 后续看点:AIGB-Pearl 的闭环优化框架能否应用于量化交易做市商报价场景
来源:量子位-公众号
微软 Copilot 取消“无限用”套餐,改按量计费,考虑引入 DeepSeek V4 降本
微软 Copilot 业务负责人宣布,Copilot Cowork 将不再提供“无限用”套餐,改为按用量计费,原因是用户使用量过高导致成本飙升。微软正考虑引入 DeepSeek V4 开源模型作为平价引擎,以降低日常任务推理成本。Copilot Cowork 已转型为 Agent,能跨 M365 生态完成多任务,但 AI Agent 消耗的 Token 量远超普通聊天,补贴模式难以为继。
- 关键事实:Copilot Cowork 取消无限用套餐,转按量计费;DeepSeek V4 性能接近顶级,但成本低且支持百万 Token 上下文
- 后续看点:微软最终是否会将 DeepSeek V4 作为默认引擎之一;按量计费对 AI 编程工具使用模式的长期影响
来源:APPSO