# ORCA-bench：让 AI 当 oncall 值班员，现在到底靠不靠谱？

> 原标题：Orca-Bench: How Ready Are Language Model Agents for Oncall?

- 来源：Hacker News 首页
- 发布时间：2026-07-31T18:32:43.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47902
- 原文：https://arxiv.org/abs/2607.28545

## 摘要

这篇论文搭了一个接近真实生产环境的测试台，用 Prometheus、Jaeger 和 OpenSearch 这些工具模拟了六天的微服务系统数据，然后让五个顶尖的编程智能体去排查 1079 个故障根因。结果最好的模型在中等难度任务上准确率只有 25.3%，困难任务上掉到 10%。最差的模型在 40% 的故障报告里直接编造了不存在的根因。一旦不让模型看源代...

## 推荐理由

这篇论文搭了个接近真实生产环境的测试台，用 Prometheus、Jaeger 和 OpenSearch 模拟了六天微服务系统数据，让五个顶尖编程智能体去排查 1079 个故障根因。结果很惨：最好模型在中等难度上准确率只有 25.3%，困难任务掉到 10%；最差的模型在 40% 的故障报告里直接编造了不存在的根因。一旦不让模型看源代码，准确率还会再打折。我会先打个折——测试环境毕竟不是真生产，但数据已经足够说明现在让模型独立接告警还太早，幻觉问题在排障场景下尤其危险。

## 锐评

这篇论文给了一个很实在的结论：现在的编程智能体离能独立值班还差得远。作者搭了一个带真实监控工具（Prometheus、Jaeger、OpenSearch）的微服务系统，模拟了六天的数据，让五个顶尖模型去查1079个故障根因。结果最好的模型在中等难度任务上准确率只有25.3%，困难任务上仅10%。最差的模型更离谱，40%的故障报告里直接编造了不存在的根因。

这个测试环境其实已经给模型开了绿灯：系统代码和监控数据都是公开的，任务也是单独排查，没有真实生产环境里那种混乱和压力。论文作者也明说，真实系统比这大好几个数量级，所以25.3%这个数字已经是乐观估计了。一旦不让模型看源代码，所有指标都往下掉，说明模型现在主要还是靠读代码猜，而不是从监控指标和日志里推理。

论文没披露的是，这些模型在排查时具体卡在哪一步，是看不懂监控面板，还是不会把告警和代码逻辑串起来。另外，测试只跑了六天的数据，故障类型可能不够多样。如果想知道模型能不能处理那种跑了几个月的系统里积攒的奇怪问题，这个测试还回答不了。
