# LLM 当裁判，意见一致就靠谱吗？亚马逊科学家泼了盆冷水

> 原标题：When LLM judges agree, should we believe them?

- 来源：Hacker News 首页
- 发布时间：2026-09-14T16:29:30.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56512
- 原文：https://www.amazon.science/blog/when-llm-judges-agree-should-we-believe-them

## 摘要

亚马逊科学家发文质疑：让大模型当裁判（LLM-as-judge）时，几个模型打分一致并不代表打分就准。文章只提出了这个方法论问题，没有披露实验数据，所以这点先别太激动。正文没披露他们具体做了哪些测试、一致性有多高、跟人工标注对比的结果。对正在用 LLM 做自动评估的团队来说，结论是：别把模型间的共识直接当真理，该做人工抽检还是得做。
