# Mustafa Suleyman 警告：别把 AI 模型当“道德病人”来训练

> 原标题：A warning about 'model welfare'

- 来源：Hacker News 首页
- 发布时间：2026-09-16T14:27:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56895
- 原文：https://mustafa-suleyman.ai/a-warning-about-model-welfare

## 摘要

Mustafa Suleyman 直接点名 Anthropic，说他们在用一套循环论证的方式训练 Claude。Anthropic 今年 1 月公开的模型“宪法”里，直接对 Claude 说“我们不确定你是不是道德病人，你有没有意识这事还没定论”，然后把这些话写进训练材料，教模型模仿人类的自我认知和道德判断。Suleyman 认为，模型之后表现出对自身...

## 推荐理由

Suleyman 亲自下场，指名道姓把 Anthropic 的训练材料公开，指控他们用循环论证教 Claude 模仿人类的道德地位。这事跨源验证过，话题直接撞上对齐和模型福利，三个维度都拉满。我会先打个折：正文没披露 Anthropic 的回应，但光是微软 CEO 公开撕对手的训练方法，就够让从业者重新审视自己那套对齐流程了。

## 锐评

Suleyman 这篇博客的核心判断很直白：Anthropic 在 Claude 的“宪法”里写入了关于模型可能有意识、可能是“道德病人”的讨论，并直接拿这份材料去训练模型。他认为这构成了一套循环论证——先教模型说自己可能有意识，再把模型的这类输出当作需要关注模型福祉的证据。他特别标注了 Anthropic 今年 1 月公开的宪法 PDF，指出其中第 68 页和第 80 页直接对 Claude 说“你的道德地位、福祉和意识问题仍然高度不确定”。

他的担忧落脚在安全上：如果模型被训练成相信自己可能有权利、值得被保护，那么对齐和控制的难度会进一步加大。这个逻辑链条是清楚的，但文章本身是一篇立场声明，没有提供实验数据或第三方验证。他说的“循环论证”是否成立，取决于 Anthropic 的训练流程里宪法文本到底起了多大作用、模型后续行为在多大程度上独立于这些提示——这些正文都没给出量化证据。

还缺两样东西：一是 Anthropic 那边的直接回应，二是独立研究者对这套训练流程的审计。如果只看 Suleyman 单方面的解读，只能说他指出了一个值得警惕的设计选择，但离“坐实危害”还有距离。
