跳到正文
新智元 · 公众号

Anthropic 内部流出一份 Claude 流畅度评分表,最高 11 分,优秀人类能拿 7.5

倒反天罡,AI开始给人类打分!Claude评分标准曝光: 优秀人类得7.5分

这份评分表把用户跟 Claude 的对话拆成 11 个可观察的行为指标来打分,满分 11 分。背后的研究用了 9830 组匿名多轮对话,发现高质量对话里 85.7% 都出现了“反复修改追问”这个动作。正文没披露具体评分细则和实验设计细节,目前只能看到评分框架,所以这个 7.5 分到底怎么算出来的还不清楚,先别太激动。

推荐理由:这篇的切入点是把 AI 和人的关系倒过来,用评分卡的形式讲 Claude 怎么分析用户行为,标题自带传播力。内容有具体的行为列表和样本量,不是空谈。我会先打个折:这不是模型发布或重大能力更新,所以放在 featured 档位刚好,不用拔到 breaking。对从业者来说,能从中看到 Anthropic 对“高质量使用”的定义,也能反推自己用 Claude 的方式在什么水平。

读原文 ↗导出 Markdown