🖼️ 图文卡片 🏠 返回首页
前沿科技洞见 · 2026-05-28

ITBench-AA 发布:前沿模型在企业 IT 排障任务中集体得分低于 50%

资料提供:前沿科技研究部
正在发生的事很多,这件帮你看过了

2026/05/28

Artificial Analysis 与 IBM Software Innovation Lab 于 2026 年 5 月 27 日联合发布 ITBench-AA——首个专门评估 AI 模型在企业 IT Agentic 任务上表现的标准化基准。首轮测试覆盖 59 个 SRE(站点可靠性工程)场景,前沿模型得分均低于 50%,是目前饱和程度最低的 Agentic 基准之一。

核心结果:Claude Opus 4.7 以 47% 得分居首;GPT-5.5 以 46% 紧随其后;Qwen3.7 Max 为 42%;开源模型 GLM-5.1 达 40%。小模型 Gemma 4 31B 以 37% 得分、$0.14/任务的成本在性价比维度上显著优于所有闭源模型。

这个基准测什么

ITBench-AA 模拟企业 SRE 工程师的真实工作场景:模型收到一份 Kubernetes 事故快照(含告警、事件、链路追踪、指标、日志、应用拓扑),需要在沙箱中用 shell 命令逐步排查,最后提交一个 JSON,列出导致事故的 Kubernetes 实体(Deployment、Service、Pod 等)。

评分方式采用 precision at full recall(全召回精确率):漏掉任意一个真正的根因实体,该次作答直接 0 分。如果全部找对,得分 = 答对的根因数 / 提交的全部实体数。每个任务重复 3 次取平均。

底层数据集 ITBench 来自 IBM Research,发表于 ICML 2025,包含 102 个真实场景覆盖 SRE、安全合规(CISO)、财务运营(FinOps)三个领域。ITBench-AA 是 Artificial Analysis 用 6 个月将 SRE 部分做成标准化评估的产物。目前 59 个任务中 40 个公开、19 个留作 held-out 测试集。

成绩单

| 模型 | SRE 得分 | 单任务成本 | 平均交互轮次 | |---|---|---|---| | Claude Opus 4.7 (Adaptive Reasoning, Max) | 47% | $5.38 | — | | GPT-5.5 (xhigh) | 46% | — | 31 | | Qwen3.7 Max | 42% | — | — | | GLM-5.1 (Reasoning) | 40% | $1.23 | — | | DeepSeek V4 Pro (Reasoning, Max) | 38% | — | — | | Gemma 4 31B (Reasoning) | 37% | $0.14 | 58 | | Gemini 3.1 Pro Preview | 30% | $2.23 | 83 |

交互多不代表得分高

GPT-5.5 平均每任务交互 31 轮拿到 46%;Gemini 3.1 Pro Preview 平均 83 轮只拿到 30%。原因在于 precision at full recall 对"过度诊断"施加了惩罚——Agent 多提交无关实体(如 chaos-mesh controller 或偶发症状)会被算作假阳性,直接拉低精确率。

开源模型打出竞争力

Gemma 4 31B ($0.14/任务,37%) 在性能上超过 Gemini 3.1 Pro Preview ($2.23,30%),成本仅为后者的 1/16。GLM-5.1 ($1.23/任务,40%) 在性能和成本之间也取得了不错的平衡。这暗示企业不一定需要部署最贵模型来处理 IT 运维任务。

MAST:从"得了几分"到"怎么输的"

IBM Research 与 UC Berkeley 同期用 MAST(多智能体系统故障分类法)对模型在 ITBench SRE 任务中的执行轨迹做了逐条标注。MAST 定义了 14 种故障模式,归为三大类:系统设计缺陷、智能体间协调失败、任务验证不足。

在 310 条 SRE 执行轨迹上的分析结果:

横跨所有模型,最强的失败预测因子是 FM-3.3(验证不正确)——Agent 在没有核对真实状态的情况下就"宣告任务完成"。

MAST 团队的建议直接:验证必须外部化,不要让模型自己批自己的作业;终止条件和循环控制应放在模型之外——加显式停止条件,或检测重复工具调用。

ITBench 原始数据中的表现更差

ITBench 论文在完整 102 个场景中测试了当时的模型,结果更惨:SRE 场景仅解决 11.4%,CISO 场景 25.2%,FinOps 场景 25.8%。两个版本讲的是同一件事:把 AI Agent 扔进真实企业 IT 环境,最好的模型也离及格线有相当距离。但 MAST 的分析首次揭示了差距的具体来源——不是推理能力不足,是验证机制缺位。修这个问题不需要等下一代模型。

参考资料

图文卡片 ⬇️ 一键下载图文卡片