OpenRouter Fusion 上场:多模型编排如何从「权宜之计」变成 AGI 新的供给法则
2026/06/16
Claude Fable 5 因出口管制被停用后,一个有点反直觉的事情发生了:用组合模型跑出来的成绩,反而超过了 Fable 5 单体的基准线。OpenRouter 本周推出的 Fusion 功能,本质上做的是一件很朴素的事——让多个模型同时作答,再让一个裁判模型挑出最优解。测试数据显示,Opus 4.8 + GPT-5.5 组合胜率 67.5%,相比之下 Fable 5 单跑是 65.5%。而且不管这个组合怎么搭,即便是不加 GPT-5.5、只让 claude 自组合,也能追平 Fable 5。成本呢?大概是 Fable 5 的一半。
这件事背后有一个挺重要的逻辑转移。过去两年行业默认的叙事是:AGI 能力由少数能训出最强单模的实验室垄断。但 OpenRouter Fusion 给出的实打实的数据说明,用编排结构替代单模天花板,是行得通的。
多模型并行加裁判:为什么这个看似“不够优雅”的办法能赢
核心机制并不复杂。先让多个模型各自独立作答同一个问题,然后用一个仲裁模型检测所有答案,把正确答案筛出来、反馈给用户。OpenRouter 把这种机制抽象成了一个叫做 Routing DSL 的可编程路由策略,用户可以自定义并行扇出、置信度级联等编排逻辑。
这里面的关键洞察,OpenRouter 自己在博文中讲得很直接:不同大模型的知识盲区和犯错方式不重叠。一个模型会在特定方向上犯系统性错误,另一个模型在同一位置可能完全正确。只要仲裁模型有足够的判别力,并行作答之后再挑一轮,整体正确率自然就被抬升了。这不是什么魔法,但它是一个被数据验证了的、可复现的模式。
Arbiter 模型(负责仲裁的那个)是做超大规模自动标注起家的公司蓄力已久的专项成果。OpenRouter 没有改造参选模型本身,而是把“谁先跑、谁负责抽检、出现分歧时听谁的”这层路由逻辑变成了一门独立的工程科目。用户也不需要为多模型并行支付叠加的单价——Fusion 的设计目标是“用拓扑换智能”而不是“用更多 token 堆智能”。
把模型编排权交给用户:路由可编程意味着什么
另一个容易被忽视的点是,OpenRouter 把这个编排逻辑做成了可编程的 DSL。这跟“平台替你选好最优模型”的自动路由完全是两码事。可编程路由意味着用户可以自己定义策略:什么场景下用快模型优先、什么场景下启动多重答题、什么场景下用低成本模型冲量、什么场景下启动仲裁严格模式。
这等于是把原本捂在网关厂商手里的调度决策权,下放给了下游应用开发者。比如一个做代码审查流水线的团队,可以把语法检查分配给轻量模型快速扇出,逻辑漏洞检查交给第二层、由仲裁模型复核,错误成本高的场景再加一层多样性投票。有了 Routing DSL,这套拓扑结构是可组合、可复用的,不只是当成一个内部引擎的优化参数。
这种开放性可能会带来的后续变化是,未来谁最擅长定义编排策略,谁就能用更低的成本获得比前沿单模更强的智能产出。建模能力依然重要,但“使用模型的能力”开始获得独立的价值——而且这部分价值是开源生态和中间件层有机会去争夺的,而不是被头部实验室天然锁定。
成本模型被撬动:AGI 供给不再只由前沿单模定义
这一点可能是整个 Fusion 消息里对产业影响最深的部分。过去讨论“下一代最强模型”时,成本几乎总是水涨船高——越强的模型越贵,越贵的模型只有少数场景用得起。Fusion 的逻辑恰好反了过来:你不需要等下一代更强但更贵的大模型发布,你只需要更聪明地用当前这代模型搭一个组合,就能获得超过下一代的智能水平,同时成本只有一半。
这个逻辑一旦被更多实践验证,可能会改变整个产业链的议价权结构。下游应用团队不用再焦虑“Claude 下一版什么时候出”“Fable 5 什么时候恢复”——他们可以主动通过拓扑设计来榨出现有模型生态的上限。大模型厂商之间的竞争,也会从单纯的单模型跑分,转向“谁能更好地被编排系统利用”——这对 API 稳定性、推理延迟、成本曲线的透明度的要求会更高。
从单模崇拜到编排能力
OpenRouter Fusion 不是第一个做多模型组合的。过去有不少研究工作在 voting、ensemble、cascade routing 方向上都有沉淀。但 Fusion 把这件事从实验变成了产品,并且拿出了一套干净的基准数据:67.5% vs 65.5%,一半的成本。这可能是整个消息最大的信号——衡量 AGI 能力的标尺,正在从“谁训出了最强单模”往“谁最聪明地使用模型组合”的方向挪。
对算力受限的团队、对国产模型的追赶路径、对 AI 应用层的成本结构而言,这个信号都值得认真对待。它不是一篇 PR 稿里的“范式转移”,但它确实是那种你过几个月回头看、会发现风向已经悄悄变了的时刻。