# ITBench-AA 发布：最前沿的模型在企业 IT 运维任务上得分不到 50%

> 原标题：ITBench-AA: Frontier Models Score Below 50% on the First Benchmark for Agentic Enterprise IT Tasks — by Artificial Analysis and IBM

- 来源：Hugging Face 博客
- 发布时间：2026-05-27T17:20:29.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/31551
- 原文：https://huggingface.co/blog/ibm-research/itbench-aa

## 摘要

Artificial Analysis 和 IBM 搞了个新基准 ITBench-AA，专门考模型能不能像真人一样处理企业 IT 的活，第一波先考站点可靠性工程（SRE）任务。结果最厉害的 Claude Opus 4.7 也只拿了 47%，GPT-5.5 是 46%，所有顶尖模型都没过半。这个测试让模型在真实的 Kubernetes 环境里查日志、追依...

## 推荐理由

HKR-H/R 都成立：前沿模型在企业 IT agent 任务上不到 50% 的准确率，既有反转感又戳中部署焦虑。HKR-K 偏弱，因为正文没给模型名单、样本量和评分机制，信息密度不够，所以重要性卡在 featured 门槛附近。

## 锐评

Artificial Analysis 和 IBM 搞了个新基准 ITBench-AA，让模型在真实的 Kubernetes 环境里当 SRE（站点可靠性工程师），查日志、追依赖、定位故障。结果挺惨：Claude Opus 4.7 只拿了 47%，GPT-5.5 是 46%，所有顶尖模型都没过半。这说明现在的模型离“能进企业 IT 流程干活”还有明显差距，不是接个 API 就能上岗。

不过这篇博客缺了几个关键信息：没写总共测了多少个任务、样本量多大，也没说评分是纯自动检查还是有人工复核。如果任务量很小，或者评分标准很主观，那 47% 这个数字就得打折。另外，测试用的是哪个版本的 Kubernetes、故障场景有多复杂，正文也没交代。这些缺口让结果只能当个趋势参考，不能直接拿来比模型好坏。

还缺一个对比：人类 SRE 工程师在同样任务上能拿多少分？没有这个基线，光说模型不及格，我们不知道这个及格线到底有多难。
