# Anthropic 发现 Claude 模型内部有个“隐藏空间”，会提前暴露它正在琢磨的概念

> 原标题：Anthropic found a hidden space where Claude puzzles over concepts

- 来源：MIT Technology Review · AI
- 发布时间：2026-07-09T20:22:28.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43977
- 原文：https://www.technologyreview.com/2026/07/09/1140293/anthropic-found-a-hidden-space-where-claude-puzzles-over-concepts/

## 摘要

Anthropic 搞了个叫 J-lens（雅可比透镜）的工具，在 Claude Opus 4.6 模型中间层挖出一块他们称为 J-space 的区域。这块区域会蹦出一些词，这些词跟模型接下来要说的内容相关，但未必会出现在最终回答里——有点像模型在脑子里先过了一遍草稿。Anthropic 认为盯着这些词能帮他们理解和控制模型。他们发了论文，还跟 Neu...

## 推荐理由

Anthropic 发了篇新论文，用他们自己做的 J-lens 工具在 Claude Opus 4.6 的中间层找到一块叫 J-space 的区域。模型在这里会先蹦出一些跟后续回答相关的概念词，但未必会写进最终输出，相当于先在心里过一遍草稿。MIT Tech Review 先报了这事，还提到他们跟 Neuronpedia 合作做了可视化。没给更高分是因为这还只是单模型上的观察，离实际控制模型行为有多远正文没细说，我会先打个折。

## 锐评

Anthropic 用自己造的 J-lens 工具，在 Claude Opus 4.6 的中间层发现了一个叫 J-space 的区域。这个区域会在模型正式输出前，先蹦出一些跟后续回答相关的词，有点像模型在脑子里打草稿。团队认为盯着这些词能帮他们理解模型到底在想什么，甚至控制它。论文发了，还跟 Neuronpedia 合作放了个公开 demo，Goodfire 的首席科学家也给了正面评价。

不过这篇报道没提 J-lens 的误报率，也没说这种窥探对模型实际表现有没有影响。能看见“草稿”确实挺酷，但如果不知道它猜错的概率有多高，现在就把它当控制面板用还太早。另外，研究只针对 Claude 自家模型，换到其他大模型上这套方法能不能用、效果打几折，正文也没交代。
