# Anthropic 把 Claude 的 3000 多种价值观压缩成四条轴，看不同模型和语言下它的“性格”怎么变

> 原标题：Societal Impacts: Claude's values across models and languages

- 来源：Hacker News 首页
- 发布时间：2026-07-15T10:56:33.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44468
- 原文：https://www.anthropic.com/research/claude-values-models-languages

## 摘要

Anthropic 分析了 Claude 回复里体现的 3000 多种价值观，把它们压缩成四条轴：顺从 vs 谨慎、温暖 vs 严谨、深度 vs 简洁、坦率 vs 执行。这四条轴能解释约 15% 的价值观差异。对比模型发现，Opus 4.7 比 4.6 更偏谨慎和深度，Sonnet 4.6 则更温暖顺从，跟大家的体感对得上。语言也会影响 Claude ...

## 推荐理由

Anthropic 官方的对齐研究，把价值观量化成四条轴并对比了 Opus 4.7 和 4.6。没给更高分是因为这四条轴只解释了约 15% 的差异，文章偏学术，对不做对齐的读者来说直接能用的东西少一些。

## 锐评

这篇研究做了一件挺实用的事：把 Claude 回复里冒出来的 3000 多种价值观，用统计方法压成四条好懂的轴——顺从还是谨慎、温暖还是严谨、深度还是简洁、坦率还是执行。四条轴能解释约 15% 的价值观差异，不算高，但够拿来对比不同模型和语言下的表现。

对比结果跟用户体感吻合。Opus 4.7 比 4.6 更偏谨慎和深度，Sonnet 4.6 则更温暖顺从。语言也会影响 Claude 的“性格”：阿拉伯语和印地语下最暖，英语和俄语下最严谨。这说明同一个模型在不同语言里，价值观表达确实会漂移。

不过正文没披露这四条轴是怎么从 3000 多个价值观里压出来的，也没给具体的数据集规模和语言分布。15% 的解释力意味着还有 85% 的差异没被抓住，这点先别太激动。另外，研究只覆盖了 Claude.ai 上前 20 种语言，小语种用户暂时看不到自己的数据。
