一图版 🏠 返回首页
前沿科技洞见 · 2026-09-09

LEAP、Capability Frontier 与 BenchMIRT:三个评测方法把总分拆回证据、预算与题目

阅读时间 6 分钟 · 3,339 字 · 基于 4 个来源
背景
今天的大模型评测,最常见的结果仍是一张排行榜:每个模型做完一套题,所有题目算出平均分,再从高到低排列。它很方便,却把评测过程中大量有用信息压掉了。模型依据哪条证据改变答案,换一个模型或多生成几次能否以更低成本答对,以及题库里的每道题究竟在测什么,最后都只剩下一个数字。
今日事件
2026 年出现的三项工作,分别拆开了这个数字的三个组成部分。
核心判断
核心判断: 三项研究的共同价值不是再增加三个指标,而是减少“算平均数”造成的信息损失。企业不必把三套方法全部叠加;应该先明确自己要改进预测过程、推理资源配置,还是题库设计,再选择相应的评测分辨率。

今天的大模型评测,最常见的结果仍是一张排行榜:每个模型做完一套题,所有题目算出平均分,再从高到低排列。它很方便,却把评测过程中大量有用信息压掉了。模型依据哪条证据改变答案,换一个模型或多生成几次能否以更低成本答对,以及题库里的每道题究竟在测什么,最后都只剩下一个数字。

2026 年出现的三项工作,分别拆开了这个数字的三个组成部分。

三项工作不是一套联合测试,也不需要被包装成三个必须同时部署的附加模块。它们解决的是同一个信息损失问题:排行榜告诉我们谁的平均分更高,这三种方法进一步解释分数由什么信息、什么运行选择和什么题目结构共同形成。

推进主线: 单模型、单次运行、整套题平均 → 看清证据怎样改变预测 → 看清预算内模型与多次生成的可达能力 → 看清每道题实际测量的能力

核心判断: 三项研究的共同价值不是再增加三个指标,而是减少“算平均数”造成的信息损失。企业不必把三套方法全部叠加;应该先明确自己要改进预测过程、推理资源配置,还是题库设计,再选择相应的评测分辨率。

一个平均分在三个环节丢掉了信息

传统评测可以简化成一条公式:一个模型,对每道题运行一次,把整套题的对错取平均。

LEAP、Capability FrontierBenchMIRT 都没有否定这张成绩单,而是分别放大了公式中的一个部分。

被压缩的环节传统做法新方法展开了什么它真正帮助回答的问题
形成答案以前把全部检索材料一次性交给模型LEAP 单独估计每条证据对不同结果的影响,再确定性聚合这次预测为什么改变,哪条材料真正起作用
得到一次答案以后只记录一个模型的一次输出Capability Frontier 比较多个模型和多次生成,在成本约束下计算可达到的最好表现固定预算怎样分配给模型选择、重复采样和结果筛选
汇总整套题时默认所有题目都在测同一种能力BenchMIRT 从模型答题模式反推每道题的难度、区分度和能力负载这套题到底测了什么,哪些题最有信息量

这才是三项工作的横向关系。它们不是互相竞争的三种测试集,也不是要求企业同时购买的三份报告。它们把评测链条从前往后依次展开:答案如何形成,计算预算如何使用,题库分数如何构成。

LEAP 把预测结果还原成一条条证据的作用

LEAP 面向的是概率预测。

典型预测 Agent 会先检索新闻、报告和网页,再把整包材料塞给模型,让它直接给出事件发生概率。即使最终答案带引用,审核人仍然很难知道,究竟是哪条材料把概率从 40% 推到了 65%,哪些材料只是被模型看过却没有产生实际影响。

LEAP 改变了预测阶段的组织方式。它先保留一个明确先验,再让模型逐条阅读证据,为不同结果估计似然,最后由确定性的概率模型完成聚合。删除某条证据后可以重新计算结果,所以同源新闻是否被重复计权、某条材料对结论贡献多大,都能留下可复核记录。

论文不仅提出方法,也建立了覆盖预测、信息检索和浏览任务的评测集,并在自有 Agent 循环及多个 Agent CLI 框架上验证。在 DeepSeek-V3.2、Gemini-3.1-Flash-Lite、Claude-Haiku-4.5、GPT-5.4-mini 和 Grok-4.20-Fast 上,LEAP 的 FutureX 得分提高 3.6 至 18.1 个百分点;接入 DeerFlow、Hermes、OpenClaw 和 MiroFlow 后,宏观平均分提高 9.8 个百分点

接近 token 预算的对照更有解释力。取消重复采样的 LEAP 每题使用 5869 个 token,FutureX 得分 0.7136;普通方案使用 5733 个 token,得分 0.6512。完整 LEAP 的 p95 延迟为 27.8 秒,高于两次普通预测的 20.4 秒。它用更清楚的证据轨迹换来了预测质量,也增加了尾延迟。

边界同样明确。LEAP 能复算聚合过程,不能自动证明输入材料为真;模型给出的先验和似然也可能受证据顺序与提示方式影响。它完善的是“预测怎样形成”的测量,不是替事实核查和稳定性测试包办所有问题。

Capability Frontier 把单次成绩扩展成预算内的可达能力

Capability Frontier 讨论的是另一种压缩。

标准排行榜通常挑一个模型,让它在每道题上生成一次,再把准确率视为这个模型能够提供的能力。现实部署却可能调用不同模型,也可能对难题生成多次并选择更好的答案。一次静态评测因此既看不到模型之间的专长互补,也看不到重复采样能够换来的性能。

研究覆盖 21 款模型和 16 个常用基准,按调用成本构建一条帕累托前沿:在给定预算下,如果能够在不同模型和多次生成之间做最优选择,最高可以达到怎样的准确率。作者还校正了直接从噪声样本中挑最高分造成的高估。

论文报告,在相同成本下,只修正“固定使用单一模型”这一限制,错误率可降低 54%;再把单次运行扩展到多次生成,提升幅度达到 82%,并可用约 15% 的成本匹配原来的最佳准确率。这些结果描述的是理想选择器下的能力上界,不是一个已经上线的路由系统凭空获得 82% 收益。

它完善评测的地方,是把问题从“哪个模型的单次平均分最高”改成“在预算约束下,一个模型组合和采样策略最多能做到什么”。真实系统能否接近这条前沿,还取决于路由器或结果判别器能否在不知道标准答案时选对输出,并承担额外延迟。

BenchMIRT 把题库总分拆回题目与能力

BenchMIRT 处理的是评测链条最后一次压缩。

很多基准在名称上只对应一种能力,但其中的题目可能同时要求安全判断、阅读理解和一般推理。把它们直接平均后,排行榜很难说明高分究竟来自目标能力,还是来自另一种被题目偷偷带入的能力。

Ai2 使用 100 款开放权重模型在 16 个基准、3.4 万多道题上的作答记录训练 BenchMIRT。方法借鉴多维项目反应理论,为每道题估计难度、区分模型的能力,以及它在不同潜在能力上的负载。研究没有预先告诉系统哪些题属于安全或推理,但分析反复恢复出安全与一般推理两条主要维度。

结果揭示了基准名称和实际测量内容之间的错位。

保留信息量最高的 10% 题目,通常仍能维持完整题库呈现的模型关系。预测留出题时,BenchMIRT 准确率为 79%,把模型的基准平均分直接套到每道题上的简单方法为 70%。

但 BenchMIRT 也没有全面战胜平均分。如果目标只是预测随机留出题上的模型排名,普通平均分略好。它的优势在于解释题库、筛选信息量高的题,以及发现一个总分混合了哪些能力;它的能力维度也会随着输入的基准集合改变。

三项研究让评测既给排名,也解释分数

把三项工作放在一起,最清楚的变化不是“平均分有三个盲区”,而是评测记录的对象变细了。

最终得分之外,这些方法还保留证据对预测的贡献、成本约束下的模型与采样选择,以及题目对能力维度的贡献。

这种变化会让评测更接近真正的测量。排名只需要回答谁高谁低;测量还要说明分数怎样产生、在什么条件下成立,以及换一个任务或预算后能否继续使用。

三套方法的使用场景因此很好区分。做金融、政策或事件预测,且答案依赖大量外部材料时,LEAP 适合检查证据如何进入概率。设计多模型路由、推理时扩展或成本策略时,Capability Frontier 提供预算与可达性能的参照。建设或裁剪内部题库时,BenchMIRT 可以检查题目究竟覆盖哪些能力、哪些题真正有区分度。

对低风险、任务固定、只需筛选候选模型的场景,平均分仍然够用。只有当决策者需要知道为什么得分、预算怎样换能力,或者题库是否测准时,才值得提高评测分辨率。

接下来的关键验证也不应把三套方法强行组合成一个新系统,而是检查各自在真实决策中有没有创造增量:LEAP 的证据记录是否减少预测复核时间,能力前沿是否能被现实路由器接近,BenchMIRT 选出的精简题集能否在新模型和新业务上维持判断。能改变模型选择、成本配置或题库设计,细粒度评测才真正有价值。

信息来源(4)

资料复核时间:2026-09-07。

图文卡片 ⬇️ 一键下载图文卡片