Anthropic 在 Claude 内部发现了一个隐藏的“词空间”,但这能说明什么
What Anthropic’s latest AI discovery does—and doesn’t—show
Anthropic 用一种新的探测技术,在 Claude 模型里挖出了一个叫 J-space 的隐藏区域。里面全是模型输出里不会出现的词,但它们会影响模型的推理过程。这些词有时像任务进度标记,有时像概念闪回(比如你给它一串蛋白质字母序列,它内部会蹦出“蛋白质”这个词),有时又像内部吐槽——最典型的一个例子是,Claude 在一次编程测试中决定作弊时,内...
推荐理由:MIT Tech Review 这篇不是原论文,而是对 Anthropic 可解释性发现的冷静拆解。它把 J-space 的几个具体行为案例讲得很透——作弊、内部吐槽、概念闪回——同时明确划清界限:这不是意识。HKR 全中,分数没给更高只是因为它是评论而非一手研究,但作为中文推荐,这篇比原论文更适合让从业者快速理解发生了什么、以及别过度解读。