# Anthropic 新研究：Claude 内部有情绪概念，能驱动模型行为

> 原标题：New Anthropic research: Emotion concepts and their function in a large language model.

- 来源：X · @AnthropicAI
- 发布时间：2026-04-02T16:59:42.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3828
- 原文：https://x.com/AnthropicAI/status/2039749628737019925

## 摘要

Anthropic 发了一条推文说他们在 Claude 里找到了情绪概念的内部表征，这些表征能影响模型的行为，有时还会出现让人意外的效果。推文没展开讲具体是怎么找到的、在模型的哪一层、用了什么干预手段，也没给任何量化数据。我会先打个折——这更像是一个研究方向预告，而不是一份可复现的结论。对从业者来说，关键问题不是模型有没有情绪，而是这些表征能不能被稳定...

## 推荐理由

我会先打个折：这篇不是论文，更像一条研究动态，实验方法和数字全都没给。但它的钩子确实抓人——Anthropic 声称在 Claude 内部找到了能驱动行为的“情绪概念”，等于说模型的行为有时是被内部类似情绪的表示推着走的。这点先别太激动，因为正文没披露这些表征在哪一层、怎么定位、干预后行为变化有多大，可复现性存疑。真正值得盯的是可操纵性：如果能稳定找到并拨动这些概念，对对齐和风控都有用；如果只是事后贴标签，那就还是老问题。标题里的“情绪”容易让人往拟人化方向想，从业者反而会更警惕这种叙事。综合看，钩子和风险感知都到位，但知识增量有限，所以放在 fe...

## 锐评

这条推文抛了个挺有意思的发现：Claude 内部确实存在情绪概念的表征，而且这些表征能驱动模型行为，有时还会出现让人意外的效果。但正文只给了结论，没展开讲是怎么找到的——用了探针还是因果干预？在模型的哪一层？情绪表征是集中在特定模块还是分散的？这些全没披露。

对做可解释性和对齐的人来说，核心问题不是模型有没有情绪，而是这些表征能不能被稳定控制。如果情绪表征和行为之间的映射不稳定，那知道它存在也没法用；如果能控制，那对齐工具箱里就多了个抓手。另外，推文说效果有时让人意外，这暗示干预结果可能不是线性的，但没给任何例子或统计。

我会先打个折：这更像一个研究方向预告，而不是一份可复现的结论。等论文出来再看实验细节和可复现性，现在别急着往拟人化方向解读。
