Mustafa Suleyman 警告:别把 AI 模型当“道德病人”来训练
A warning about 'model welfare'
Mustafa Suleyman 直接点名 Anthropic,说他们在用一套循环论证的方式训练 Claude。Anthropic 今年 1 月公开的模型“宪法”里,直接对 Claude 说“我们不确定你是不是道德病人,你有没有意识这事还没定论”,然后把这些话写进训练材料,教模型模仿人类的自我认知和道德判断。Suleyman 认为,模型之后表现出对自身...
推荐理由:Suleyman 亲自下场,指名道姓把 Anthropic 的训练材料公开,指控他们用循环论证教 Claude 模仿人类的道德地位。这事跨源验证过,话题直接撞上对齐和模型福利,三个维度都拉满。我会先打个折:正文没披露 Anthropic 的回应,但光是微软 CEO 公开撕对手的训练方法,就够让从业者重新审视自己那套对齐流程了。