跳到正文
Hacker News 首页

LLM 能察觉自己脑子里在想什么吗?这篇论文直接往模型内部塞概念来测试

Emergent Introspective Awareness in Large Language Models

Jack Lindsey 没走对话测试的老路,而是直接把已知概念的向量表示注入模型内部激活值,看模型能不能自己报告出来。Claude Opus 4 和 4.1 在多数实验里表现最好:它们能发现被注入的概念,能回忆之前的状态,还能区分自己生成的输出和人类写的预填充文本。这个能力确实存在,但非常不稳定、看上下文,而且不同模型差异很大,跟后期训练怎么调教关系...

推荐理由:我会先打个折:这篇论文的方法确实新鲜,不是让模型聊天,而是直接往激活值里塞概念向量,看它能不能自己察觉。Claude Opus 4 系列在检测注入概念、回忆状态、区分自己输出和人类文本上表现突出,但正文也说了,这个能力很不稳定、看上下文,不同模型差异大,跟后期训练怎么调教关系密切。方法够硬,发现够具体,但还只是一篇论文,没有其他团队复现或讨论,所以重要性给到 78,放在 featured 里,让懂行的人自己判断。

读原文 ↗导出 Markdown