前沿科技日报 · 2026-06-16
OpenRouter 多模型协作逼近 Fable 5,复旦提出视频生成驱动多模态推理,AI Agent 身份与权限管理成新热点
2026-06-16 前沿科技洞见 · 日报
📊 今日关键数据
- 67.5%:OpenRouter Fusion 组合(Opus 4.8 + GPT-5.5)胜率,超越 Fable 5 的 65.5%(来源:OpenRouter Blog)
- 1280 TOPS:理想自研马赫 M100 Ultra 芯片算力,算力利用率 >82%(来源:智东西)
- 4149 个样本:复旦大学 VideoThinkBench 多模态推理基准测试规模(来源:BAAI 智源)
- 排名第一:摩尔线程 MusaCoder-27B-RL 在 KernelBench 上,首次国产 GPU 全链路训练登顶(来源:AI提效手册)
- 96.1%:Kairos 在 RoboTwin 2.0 双臂操作成功率,LIBERO-Plus 泛化评分 89.0(来源:AI前线)
- 1000+ 小时:RW‑RL‑Dataset 首版真实机器人数据规模,覆盖 30+ 任务模板(来源:钛媒体)
- 超 1.2 亿美元:AI Agent 基础设施融资,Arcade 6000 万美元 A 轮 + NewCore 6600 万美元种子轮(来源:TechCrunch、Tech in Asia)
- 12.2 年:Anthropic 工程师经验中位数,博士占比仅 13.7%(来源:机器之心-公众号)
- 超 1.4 亿次:腾讯元宝接入 ima 知识库后的知识调用量(来源:财联社AI daily-公众号)
🔍 今日值得深读
OpenRouter 推出 Fusion 多模型协作:组合智能逼近 Fable 5,成本仅一半
在 Claude Fable 5 因出口管制被停用后,AI 网关 OpenRouter 推出了 Fusion 功能,通过让多个模型并行作答、再由裁判模型仲裁最优解的方式,使常规模型组合的综合胜率追平甚至反超 Fable 5 单体基准线。测试显示,Opus 4.8 与 GPT-5.5 组合得分约 67.5%,超过 Fable 5 单跑的 65.5%;即便是 Opus 自组合也能追平 Fable 5。
这一方案的核心逻辑是:不同模型的知识盲区和犯错方式不重叠,各自独立作答后,用仲裁模型挑出正确答案,整体正确率自然被抬升。OpenRouter 将此编排逻辑以可编程路由策略 Routing DSL 的形式交给用户,支持并行扇出、置信度级联等策略,可在不增加单价的情况下,用"拓扑结构"换取更高智能。
这改变了 AGI 能力只能由少数前沿模型垄断的叙事。当模型编排和开源生态系统开始从几家头部实验室手中分流价值,衡量 AGI 能力的标尺正在从“谁训出最强单模”转向“谁最聪明地使用模型组合”。
- 关键事实:OpenRouter Fusion 通过多模型并行+仲裁,使 Opus 4.8 + GPT-5.5 组合胜率达 67.5%,超过 Fable 5 的 65.5%,成本约为 Fable 5 的一半
- 为什么值得深读:它证明模型编排和组合智能可以替代对单一最强模型的依赖,正在重塑 AGI 能力供给的产业结构和成本模型
- 后续看点:OrcaRouter 多模型融合运行时已进入灰度测试,Qwen3.6-27B 等国产模型能否通过类似编排持续逼近前沿水平
理想汽车发布马赫 M100 Ultra 自研芯片:1280TOPS,MindVLA 大模型定义车端世界模型
理想汽车在软件与具身智能发布会上,掏出了自研的马赫 M100 Ultra 芯片——单颗算力 1280TOPS,采用 5nm 车规级工艺和数据流架构,实际算力利用率超 82%。这枚芯片不只用于辅助驾驶,而是跑通车上所有智能化场景,包括语言大模型、Agent、多模态感知和具身智能任务,被理想定位为具身智能汽车的"心脏"。
配合芯片,理想发布了 MindVLA 大模型作为具身智能"大脑",3D ViT 感知模型作为"眼睛",构建了从感知、计算、决策到执行的完整具身智能系统 Livis。CTO 谢炎用马赫芯片的数据流架构说明其设计哲学:AI 计算天然是并行的,数据流动路径清晰,不再让中央指令队列主导计算,而是让数据流动驱动计算发生。
这是中国车企首次把自研芯片、VLA 大模型、智驾和座舱全部打通,形成完整的车端 AI 闭环。理想将这套能力体系具象化为"机器人"形象,标志着汽车行业的竞争正从电动化转向"谁能定义具身智能终端"。
- 关键事实:理想自研马赫 M100 Ultra,单芯片 1280TOPS,实际算力利用率超 82%,覆盖语言大模型、Agent、多模态感知和具身智能全场景
- 为什么值得深读:它展示了一条"自研芯片+VLA大模型+全线控底盘"的垂直整合路径,将汽车重新定义为具身智能终端,推动了 Agent 从数字世界走进物理世界的规模化实践
- 后续看点:马赫 VLA 能否在真实道路场景中验证其"安全与效率超越人类"的目标;该垂直整合模式能否被其他车企复制
来源:智东西
复旦大学提出 Thinking with Video:视频生成作为多模态推理新范式,被 CVPR 2026 收录
复旦大学邱锡鹏团队在 CVPR 2026 上提出 Thinking with Video 新范式,让视频生成模型以视频帧为统一媒介进行多模态推理,打破了视觉与文本的割裂。实验显示,Sora-2 在 Eyeballing Puzzles 几何推理任务上击败了 GPT-5、Claude Sonnet 4.5 和 Gemini 2.5 Pro 三个顶尖 VLM,在 Visual Puzzles 对称任务中也击败了 Claude Sonnet 4.5。
研究团队构建了 VideoThinkBench 基准,包含 4149 个测试样本。核心发现是:视频生成模型能像人一样"画图模拟"——在视频中模拟光线延伸和反射,操纵几何元素辅助推理,这种能力是纯文本或静态图像推理所不具备的。更令人意外的是,视频生成模型也能解决 MATH、MMLU 等文本推理任务。
这项研究预判了谷歌 Gemini Omni 此前曝光的"教授黑板推公式"能力,提示了一种可能的技术方向:视频生成不仅是内容创作工具,还可以成为多模态推理的通用载体。数据和代码已全面开源。
- 关键事实:Sora-2 在几何直觉推理任务上击败 GPT-5、Claude 4.5 和 Gemini 2.5 Pro;视频生成模型被发现可解决 MATH、MMLU 等文本推理任务
- 为什么值得深读:它将视频生成重新定位为多模态推理基础设施,而非单纯的 AIGC 工具,可能开启一条不同于 VLM 的推理能力提升路径
- 后续看点:Google Gemini Omni 是否真的内置了类似的视频生成推理能力;其他视频生成模型是否会跟进这一范式
来源:BAAI 智源
国产 GPU 训练 AI 写内核:摩尔线程 MusaCoder 登顶 KernelBench,首次实现全链路国产算力训练
摩尔线程的 MusaCoder-27B-RL 大模型在 KernelBench 基准测试中排名第一,这是业内首个基于国产 GPU 算力底座完成全链路训练的开源代码大模型。该模型能自动将 PyTorch 代码转换为 CUDA 与 MUSA 内核,实质上是让 AI 自己学会编写 GPU 底层代码。
KernelBench 是评估大模型编写高效 GPU 内核代码能力的基准测试,直接反映模型对硬件计算资源的调度效率。MusaCoder 的核心技术突破在于 MooreEval 执行式验证协议——模型生成的内核代码会被实际编译运行,通过真实性能反馈进行强化学习训练,而非仅依赖静态代码审查。
在高端 GPU 供应持续受限的背景下,AI 辅助芯片编程正成为提升国产算力利用率的关键杠杆。MusaCoder 表明,即便硬件制程受限,通过 AI 优化底层软件栈,仍有可能在特定任务上逼近甚至超过硬件原生性能。
- 关键事实:MusaCoder-27B-RL 在 KernelBench 排名第一,首次基于国产 GPU 完成全链路训练;MooreEval 协议通过真实执行反馈进行强化学习优化
- 为什么值得深读:它展示了"用 AI 优化 AI 算力基础设施"的闭环——在硬件受限条件下,通过软件和 AI 能力弥补代差,这是中国 AI 算力自主的核心路径之一
- 后续看点:MusaCoder 能否在其他国产 GPU 平台(如寒武纪、天数智芯)上复现类似效果;开源后能否形成社区驱动的内核优化生态
来源:AI提效手册
🔥 今日聚合动态
AI 编程范式加速转移:Codex 自主派活,Loop Engineering 替代 Prompt 工程,Coding Agent 技术全景图发布
过去 24 小时,AI 编程领域出现三条指向同一趋势的信息:人与 AI 的协作方式正在从"手写提示词、拆解步骤"转向"设定目标、设计自动化循环"。Codex 推出 /goal 功能,让模型自主拆解任务、调度子 Agent、执行并检查结果;Google Cloud AI 总监提出 Loop Engineering 概念,将自动化流程分为定时任务、工作树、Skills、连接器和子 Agent 五大组件;InfoQ 发布 Coding Agent 技术全景图,梳理了 Context Engineering、Subagents 与 Harness 一年来的范式转移。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 工具实践 | 新智元 | Codex /goal 功能让模型接管目标设定,自主拆解任务并调度子 Agent 执行,程序员角色转向目标定义和结果验证 |
| 架构框架 | 机器之心 | Loop Engineering 由自动化、工作树、Skills、MCP 和子 Agent 五组件构成,核心是定义可验证目标而非编写操作步骤 |
| 全景梳理 | InfoQ | Coding Agent 技术全景图揭示一年范式转移:从 Prompt 工程到 Context 工程,从单 Agent 到 Multi-Agent 编排 |
- 关键事实:Codex、Cursor、Claude Code 等主流工具均向"目标驱动、自主执行"方向迭代;Loop Engineering 被多位行业人士称为"Prompt 工程的继任者"
- 互补信息:Codex 的实践暴露了成本问题——自主执行可能导致 Token 用量暴增,一小时烧掉 1400 美元的极端案例引发对成本控制的讨论;Loop Engineering 的理论框架则强调需要设置消费限额和边界条件
- 后续看点:这些新范式的实际采用率如何,是否会出现统一的 Agent 编排标准或协议
AI Agent 基础设施加速成型:权限管理两笔大额融资,多 Agent 编排层走向产品化
AI Agent 走向“数字员工”的两大基础条件——身份权限管理与多 Agent 协同编排——在同一天迎来重要信号。Arcade 完成 6000 万美元 A 轮融资,专注 AI Agent 授权边界管理;NewCore 以 6600 万美元种子轮走出隐身模式,统一管理人机身份权限。与此同时,Databricks 推出 Omnigent 编排层,支持单会话同时监督 Claude Code、Codex、Pi 等多 Agent 协同工作。
| 视角 | 来源 | 核心信息 |
|---|---|---|
| 身份权限 | TechCrunch | Arcade 获 6000 万美元 A 轮,构建 AI Agent 授权边界管理;NewCore 获 6600 万美元种子轮,统一管理人机身份,解决“管 Agent”难题 |
| 编排协同 | Tech in Asia | Databricks Omnigent 编排层可实现单会话多 Agent 监督,打通数据治理与权限控制,企业级 Agent 协同走向产品化 |
- 关键事实:Arcade 和 NewCore 合计融资超 1.2 亿美元;Databricks Omnigent 在同一日推出跨 Agent 编排产品,覆盖权限、协同与数据治理
- 互补信息:权限管理解决 Agent “能做什么”,编排层解决“多 Agent 如何协同”,二者共同构成企业部署 AI Agent 的基础设施层
- 后续看点:主流云厂商是否会在 IAM 产品中内置 Agent 权限管理;Agent 编排层能否形成统一标准或协议
📰 独立报道
🤖 AGI 前沿
腾讯元宝接入 ima 知识库:AI 回答可溯源至专业知识内容
腾讯宣布其 AI 助手元宝已接入 ima 知识库,用户在元宝内搜索时可直接调用 ima 中海量的专业知识内容,获得可溯源的 AI 回答。点击信源引用卡片可跳转至 ima 原文并加入个人知识库。ima 知识号已覆盖金融、法律、医疗等 20 余个行业,知识内容已被应用超过 1.4 亿次。这一动作将 AI 助手从"通用对话"推向"领域知识服务",其核心价值在于回答的可信度和可溯源性——这对于金融等强监管行业的 AI 应用尤为关键。
- 关键事实:元宝接入 ima 知识库,覆盖 20+ 行业,ima 知识内容已被应用超 1.4 亿次
- 后续看点:接入知识库后,元宝在高专业度场景(如法条引用、财报解读)中的准确率能否显著提升
均普智能联合发布全球首个面向真实机器人强化学习的大规模数据集 RW-RL-Dataset
均普智能旗下宁波具身智能机器人创新中心联合博登智能、上海交大 MINT 实验室,开源全球首个面向真实机器人强化学习的大规模数据集 RW-RL-Dataset 首批数据。该数据集打破了传统机器人数据只记录"成功轨迹"的局限,完整记录了执行过程中的成功、失败与恢复全过程,并提供完整的 Reward 信号和 RL 训练标签。第一版包含 1000+ 小时真实机器人数据,覆盖 4+ 类机器人系列、30+ 任务模板。其核心工业属性在于:这批数据源自真实工业需求中的拆装箱、穿线插接、零件分拣等任务,解决了"机器人只会模仿、不会自救"的行业痛点。
- 关键事实:RW-RL-Dataset 首版包含 1000+ 小时真实机器人数据,覆盖 4+ 机器人系列、30+ 任务模板,提供完整 Reward 和 RL 训练标签
- 后续看点:开源后能否吸引更多团队在同一批真实轨迹上复现实验、比较方法;2026 年底前能否按计划达到 3000 小时以上数据集规模
来源:钛媒体
大晓机器人开源开悟世界模型 Kairos:全球权威评测多项第一,4B 模型可端侧直驱机器人
大晓机器人开源开悟世界模型 Kairos,在 RoboTwin 2.0、LIBERO-Plus、WorldModelBench 等全球权威具身智能评测中均获第一。Kairos 在 RoboTwin 2.0 复杂双臂操作评测中以 96.1% 成功率夺冠;在 LIBERO-Plus 场景泛化能力评测中以 89.0 分登顶全球榜首。其核心创新是首创原生统一架构,实现"多模态理解—生成—预测"一体化,不再将感知、规划、控制分开建模。更关键的是,Kairos-4B 成为全球首款可端侧直驱机器人本体的具身世界模型,无需云端算力即可在真实环境中运行。
- 关键事实:Kairos 在 RoboTwin 2.0 双臂操作成功率 96.1%,LIBERO-Plus 泛化能力 89.0 分;Kairos-4B 可端侧直驱机器人本体
- 后续看点:Kairos 在更多真实家庭或工业场景中的泛化表现;能否推动世界模型从"学术评测冠军"走向"实际可部署"
来源:AI前线
北大团队开源 Narwhal AI Code Risks:识别 AI 生成代码的七类潜在风险
北京大学 Narwhal-Lab 开源了 Narwhal AI Code Risks 项目,旨在帮助开发者识别 AI 生成代码的潜在风险。项目整理了大量真实案例、早期信号和典型风险路径,将风险分为供应链、代码漏洞、云配置、Agent 等七类。其背景是:AI 生成代码可能语法正确、功能正常,但存在语义偏离风险——例如引入不安全的依赖版本、暴露 API 密钥、或生成存在逻辑缺陷的 Agent 决策链。项目以"航行日志"的形式记录风险模式,为 AI 辅助编程的安全审计提供了可操作的参考框架。
- 关键事实:Narwhal AI Code Risks 覆盖供应链、代码漏洞、云配置、Agent 等七类风险,整理大量真实案例和典型风险路径
- 后续看点:该项目能否与主流 AI Coding 工具(如 Copilot、Codex)集成,实现风险实时检测
来源:新智元-公众号
田渊栋创办的 Recursive 发布首份成果:三个基准均拿下 SOTA
田渊栋创办的 Recursive 公司发布首份研究成果,其 AI 系统在固定预算语言模型训练、小模型训练速度、GPU 内核优化三个基准测试中均取得 SOTA。在 NanoChat Autoresearch 基准中,系统将 BPB 提升 0.0263,超越社区平均水平;在 NanoGPT Speedrun 基准中,将训练时间从 79.7 秒缩短至 77.5 秒。Recursive 的核心思路是让 AI 自动完成"提出想法—写代码—跑实验—验证结果"的完整循环,本质上是用 AI 来优化 AI 研发过程本身。
- 关键事实:Recursive 在三个基准测试中均获 SOTA,将 NanoGPT 训练时间缩短 2.2 秒
- 后续看点:Recursive 的自动化研究循环能否扩展到更大规模的模型训练和更复杂的实验设计
来源:AIGC开放社区-公众号
🏢 AI 战略与组织变革
Anthropic 工程团队画像:1680 人,平均 12 年经验,基础设施工程师占比 40%,博士仅 13.7%
一份对 1680 位 Anthropic 员工 LinkedIn 履历的分析揭示了其招人底牌:工程师经验中位数 12.2 年,44% 有 13 年以上经验;40% 有基础设施背景,强化学习背景仅占 3.3%;博士学位工程师仅占 13.7%。Google 是最大人才来源。这张画像与外界对 Anthropic 的普遍认知形成反差——它更像一个"基础设施工程公司"而非"理论 AI 研究实验室"。这与 Anthropic 近期因 Fable 5 封禁和用户成本反弹所面临的处境相呼应:模型能力竞赛之外,工程稳定性和规模化部署能力正在成为竞争焦点。
- 关键事实:Anthropic 工程师中位数经验 12.2 年,40% 有基础设施背景,博士占比仅 13.7%
- 后续看点:Anthropic 的基础设施投入能否转化为更低的推理成本和更稳定的服务
来源:机器之心-公众号