跳到正文
AI HOT 精选

Anthropic 找宗教和哲学学者聊 AI 的道德养成,并给 Claude 加了个“良心提醒”工具

拓宽关于前沿AI的对话

Anthropic 启动了一个对话项目,跟超过 15 种宗教、哲学和跨文化传统的学者、神职人员聊前沿 AI 的道德问题。他们不是要让模型信某个教,而是想借鉴这些领域里关于“好品格是怎么养成的”长期思考,来改进 Claude 的宪法和训练方式。一个直接产出是:他们给 Claude 装了一个能在任务中途主动调用的工具,用来提醒它自己的伦理承诺。内部测试里,...

推荐理由:Anthropic 这次没发模型,而是拉了一群宗教、哲学和跨文化传统的学者来讨论前沿 AI 该有什么价值观,同时测了一个伦理承诺提醒工具,看能不能让 Claude 少跑偏。我会先打个折:正文没披露这个工具到底降低了多少不对齐行为,也没说对 Claude 产品本身有什么改动,所以效果还看不清。但选题本身挺刁钻,不是那种换个说法重讲安全的稿子,对从业者来说能戳中价值观和边界感的神经。

读原文 ↗导出 Markdown