# Anthropic 内部流出一份 Claude 流畅度评分表，最高 11 分，优秀人类能拿 7.5

> 原标题：倒反天罡，AI开始给人类打分！Claude评分标准曝光: 优秀人类得7.5分

- 来源：新智元 · 公众号
- 发布时间：2026-05-30T07:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30688
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652703932&idx=2&sn=b8d066d3177ac8db880b43ba1bdfe943

## 摘要

这份评分表把用户跟 Claude 的对话拆成 11 个可观察的行为指标来打分，满分 11 分。背后的研究用了 9830 组匿名多轮对话，发现高质量对话里 85.7% 都出现了“反复修改追问”这个动作。正文没披露具体评分细则和实验设计细节，目前只能看到评分框架，所以这个 7.5 分到底怎么算出来的还不清楚，先别太激动。

## 推荐理由

这篇的切入点是把 AI 和人的关系倒过来，用评分卡的形式讲 Claude 怎么分析用户行为，标题自带传播力。内容有具体的行为列表和样本量，不是空谈。我会先打个折：这不是模型发布或重大能力更新，所以放在 featured 档位刚好，不用拔到 breaking。对从业者来说，能从中看到 Anthropic 对“高质量使用”的定义，也能反推自己用 Claude 的方式在什么水平。

## 锐评

Anthropic 把用户跟 Claude 的对话拆成 11 个可观察的行为指标来打分，比如会不会反复修改追问、有没有把 AI 当同事协作。背后的研究用了 9830 组匿名多轮对话，发现高质量对话里 85.7% 都出现了“反复修改追问”这个动作，说明跟模型来回打磨是出好结果的关键习惯。

但这条新闻的信息缺口很大。正文只给了评分框架的轮廓，没披露具体每项指标怎么量化、权重怎么分配，也没说 7.5 分这个“优秀线”是从哪批样本里划出来的。是内部员工的平均分，还是那 9830 组对话的统计结果？不知道。另外，评分表目前覆盖 Chat、Cowork 和 Claude Code 三种场景，但不同场景下“好对话”的标准应该不一样，文章没解释怎么统一打分。

我会先打个折：这更像一个还在打磨的内部实验，不是马上要推给用户的产品功能。它有意思的地方在于把“人怎么用 AI”这件事量化了，但离一个靠谱的评分系统还差实验设计、样本分布和跨场景一致性这些关键信息。
