LLM 当裁判,意见一致就靠谱吗?亚马逊科学家泼了盆冷水
When LLM judges agree, should we believe them?
亚马逊科学家发文质疑:让大模型当裁判(LLM-as-judge)时,几个模型打分一致并不代表打分就准。文章只提出了这个方法论问题,没有披露实验数据,所以这点先别太激动。正文没披露他们具体做了哪些测试、一致性有多高、跟人工标注对比的结果。对正在用 LLM 做自动评估的团队来说,结论是:别把模型间的共识直接当真理,该做人工抽检还是得做。
When LLM judges agree, should we believe them?
亚马逊科学家发文质疑:让大模型当裁判(LLM-as-judge)时,几个模型打分一致并不代表打分就准。文章只提出了这个方法论问题,没有披露实验数据,所以这点先别太激动。正文没披露他们具体做了哪些测试、一致性有多高、跟人工标注对比的结果。对正在用 LLM 做自动评估的团队来说,结论是:别把模型间的共识直接当真理,该做人工抽检还是得做。