# LLM 能察觉自己脑子里在想什么吗？这篇论文直接往模型内部塞概念来测试

> 原标题：Emergent Introspective Awareness in Large Language Models

- 来源：Hacker News 首页
- 发布时间：2026-08-11T21:14:10.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50104
- 原文：https://arxiv.org/abs/2601.01828

## 摘要

Jack Lindsey 没走对话测试的老路，而是直接把已知概念的向量表示注入模型内部激活值，看模型能不能自己报告出来。Claude Opus 4 和 4.1 在多数实验里表现最好：它们能发现被注入的概念，能回忆之前的状态，还能区分自己生成的输出和人类写的预填充文本。这个能力确实存在，但非常不稳定、看上下文，而且不同模型差异很大，跟后期训练怎么调教关系...

## 推荐理由

我会先打个折：这篇论文的方法确实新鲜，不是让模型聊天，而是直接往激活值里塞概念向量，看它能不能自己察觉。Claude Opus 4 系列在检测注入概念、回忆状态、区分自己输出和人类文本上表现突出，但正文也说了，这个能力很不稳定、看上下文，不同模型差异大，跟后期训练怎么调教关系密切。方法够硬，发现够具体，但还只是一篇论文，没有其他团队复现或讨论，所以重要性给到 78，放在 featured 里，让懂行的人自己判断。

## 锐评

Jack Lindsey 的这篇论文绕开了让模型自己描述内心活动的老套路——那种方法分不清模型是真知道还是瞎编。他直接往模型内部激活值里注入已知概念的向量表示，然后看模型能不能在输出里报告“我刚才被塞了什么东西”。Claude Opus 4 和 4.1 在多数实验里表现最好：能发现被注入的概念，能回忆之前的状态，还能区分自己生成的输出和人类写的预填充文本。

这个能力确实存在，但论文自己强调它“高度不可靠、依赖上下文”。不同模型差异很大，跟后期训练怎么调教关系密切，不是模型越大就一定越强。模型在被要求或激励“想某个概念”时，也能主动调整内部激活值，说明它有一定程度的内部状态控制力。

论文管这叫“功能性内省意识”，跟人类的自我反思不是一回事。正文没披露实验用了多少样本、注入的概念覆盖多广，也没说这种能力在真实应用里能稳定到什么程度。这点先别太激动，把它当成模型对自己内部状态的一种粗糙感知能力就好，离“有意识”还差得远。
