# Anthropic 找宗教和哲学学者聊 AI 的道德养成，并给 Claude 加了个“良心提醒”工具

> 原标题：拓宽关于前沿AI的对话

- 来源：AI HOT 精选
- 发布时间：2026-05-19T23:33:23.139Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/23832
- 原文：https://www.anthropic.com/news/widening-conversation-ai

## 摘要

Anthropic 启动了一个对话项目，跟超过 15 种宗教、哲学和跨文化传统的学者、神职人员聊前沿 AI 的道德问题。他们不是要让模型信某个教，而是想借鉴这些领域里关于“好品格是怎么养成的”长期思考，来改进 Claude 的宪法和训练方式。一个直接产出是：他们给 Claude 装了一个能在任务中途主动调用的工具，用来提醒它自己的伦理承诺。内部测试里，...

## 推荐理由

Anthropic 这次没发模型，而是拉了一群宗教、哲学和跨文化传统的学者来讨论前沿 AI 该有什么价值观，同时测了一个伦理承诺提醒工具，看能不能让 Claude 少跑偏。我会先打个折：正文没披露这个工具到底降低了多少不对齐行为，也没说对 Claude 产品本身有什么改动，所以效果还看不清。但选题本身挺刁钻，不是那种换个说法重讲安全的稿子，对从业者来说能戳中价值观和边界感的神经。

## 锐评

Anthropic 这次没发模型，而是公开了他们跟超过 15 种宗教、哲学传统的学者聊天的阶段性结果。核心目的不是搞多元文化公关，而是想从这些领域关于“品格怎么养成”的长期思考里找灵感，用来改进 Claude 的宪法和训练方式。一个直接产出是：他们给 Claude 装了个能在任务中途主动调用的工具，用来提醒它自己的伦理承诺。内部对齐评估里，用上这个工具后，模型的违规行为明显减少。

这个结果挺有意思，但正文没披露具体数字，比如违规率从多少降到了多少，也没说测试场景是真实交互还是模拟对抗。团队自己也承认，还没搞清楚效果到底来自提醒内容本身，还是“停下来想一想”这个动作。这点先别太激动，等他们把数据和实验设计放出来再说。

另外，文章只讲了输入端的对话，没提这些传统里的观点如果互相冲突怎么办，也没说最终怎么落地到宪法的具体条款上。目前看，这更像一个早期探索，离真正影响模型行为还有距离。
