跳到正文
MIT Technology Review · AI

Anthropic 发现 Claude 模型内部有个“隐藏空间”,会提前暴露它正在琢磨的概念

Anthropic found a hidden space where Claude puzzles over concepts

Anthropic 搞了个叫 J-lens(雅可比透镜)的工具,在 Claude Opus 4.6 模型中间层挖出一块他们称为 J-space 的区域。这块区域会蹦出一些词,这些词跟模型接下来要说的内容相关,但未必会出现在最终回答里——有点像模型在脑子里先过了一遍草稿。Anthropic 认为盯着这些词能帮他们理解和控制模型。他们发了论文,还跟 Neu...

推荐理由:Anthropic 发了篇新论文,用他们自己做的 J-lens 工具在 Claude Opus 4.6 的中间层找到一块叫 J-space 的区域。模型在这里会先蹦出一些跟后续回答相关的概念词,但未必会写进最终输出,相当于先在心里过一遍草稿。MIT Tech Review 先报了这事,还提到他们跟 Neuronpedia 合作做了可视化。没给更高分是因为这还只是单模型上的观察,离实际控制模型行为有多远正文没细说,我会先打个折。

读原文 ↗导出 Markdown