# 人大高瓴发了一篇40页综述，专门讲怎么给大模型打分

> 原标题：Rubrics综述：Agent时代，如何定义一个「好答案」？

- 来源：机器之心 · 公众号
- 发布时间：2026-05-31T05:08:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30874
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651036001&idx=3&sn=137934964f0930f34602672e2e8498a3

## 摘要

这篇综述把“评分标准（Rubrics）”这件事拆成了五个部分来讲：定义、怎么构建、怎么用来训练、怎么用来评估、以及还没解决的难题。它想回答一个很实际的问题：在模型能自己调用工具、走流程干活的 Agent 时代，光看答案对不对已经不够了，得有一套更细的尺子来衡量“好答案”到底好在哪里。正文没披露具体的实验数据，更像是一张研究地图，帮从业者快速看清这个方向...

## 推荐理由

这篇综述没发布新模型或产品，但 40 页的框架对 agent 评测很有用，我会先打个折，放在 featured 档。正文没披露具体实验数据，更像文献梳理，但问题意识够强，从业者能直接拿来对照自己的评估流程。

## 锐评

这篇综述来自人大高瓴人工智能学院，40页篇幅把“评分标准”这件事从头捋到尾：怎么定义、怎么构建、怎么用来训练模型、怎么用来评估、还有哪些坑没填。它想解决一个很实际的问题——模型现在能自己调工具、走流程干活了，光看最终答案对不对已经不够，得有一套更细的尺子来衡量“好”到底好在哪里。

不过正文没披露任何实验数据或对比结果，更像一份文献梳理和方向指南。它告诉你这个领域有哪些主流做法、各自卡在什么地方，但没有给出“哪种方法更好”的结论。如果你正在做 Agent 评测或想用评分标准来微调模型，这篇可以当索引用，但别指望直接拿到可复现的方案。

还缺的东西挺明显：没有实际案例展示一套评分标准怎么落地，也没讨论不同领域（比如医疗、法律）的评分标准差异有多大。这些恰好是工程落地时最头疼的部分。
