# Google AI 团队分享：怎么给“用模型当裁判”写一份靠谱的评分标准

> 原标题：Google AI 团队分享如何为 LLM-as-a-Judge 评测编写可靠的评分标准

- 来源：AI HOT 精选
- 发布时间：2026-09-02T16:35:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54334
- 原文：https://dev.to/googleai/how-to-write-reliable-rubrics-for-llm-as-a-judge-evaluations-ndp

## 摘要

这是 Google AI 系列文章的第二篇，讲的是怎么让“用大模型给大模型打分”这件事更靠谱。核心思路是把评分标准写成一组严格、客观的是非题，而不是让裁判模型去“感觉”答案好不好。文章给了四条规则：每条问题只检查一个点，别把多个要求塞进一句话；不同问题之间别重复检查同一个东西，否则一个错误会被扣两次分；用布尔判断（是/否）代替主观打分；把评分标准当成正...
