ITBench-AA 发布:最前沿的模型在企业 IT 运维任务上得分不到 50%
ITBench-AA: Frontier Models Score Below 50% on the First Benchmark for Agentic Enterprise IT Tasks — by Artificial Analysis and IBM
Artificial Analysis 和 IBM 搞了个新基准 ITBench-AA,专门考模型能不能像真人一样处理企业 IT 的活,第一波先考站点可靠性工程(SRE)任务。结果最厉害的 Claude Opus 4.7 也只拿了 47%,GPT-5.5 是 46%,所有顶尖模型都没过半。这个测试让模型在真实的 Kubernetes 环境里查日志、追依...
推荐理由:HKR-H/R 都成立:前沿模型在企业 IT agent 任务上不到 50% 的准确率,既有反转感又戳中部署焦虑。HKR-K 偏弱,因为正文没给模型名单、样本量和评分机制,信息密度不够,所以重要性卡在 featured 门槛附近。