跳到正文
Hacker News 首页

ORCA-bench:让 AI 当 oncall 值班员,现在到底靠不靠谱?

Orca-Bench: How Ready Are Language Model Agents for Oncall?

这篇论文搭了一个接近真实生产环境的测试台,用 Prometheus、Jaeger 和 OpenSearch 这些工具模拟了六天的微服务系统数据,然后让五个顶尖的编程智能体去排查 1079 个故障根因。结果最好的模型在中等难度任务上准确率只有 25.3%,困难任务上掉到 10%。最差的模型在 40% 的故障报告里直接编造了不存在的根因。一旦不让模型看源代...

推荐理由:这篇论文搭了个接近真实生产环境的测试台,用 Prometheus、Jaeger 和 OpenSearch 模拟了六天微服务系统数据,让五个顶尖编程智能体去排查 1079 个故障根因。结果很惨:最好模型在中等难度上准确率只有 25.3%,困难任务掉到 10%;最差的模型在 40% 的故障报告里直接编造了不存在的根因。一旦不让模型看源代码,准确率还会再打折。我会先打个折——测试环境毕竟不是真生产,但数据已经足够说明现在让模型独立接告警还太早,幻觉问题在排障场景下尤其危险。

读原文 ↗导出 Markdown