# 在六个开源模型上复现 J-space：中间层藏着一本可操控输出的方向词典

> 原标题：J-space comparisons across open models

- 来源：Hacker News 首页
- 发布时间：2026-07-15T15:57:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44524
- 原文：https://eliebak.com/viz/jspace-open-v2

## 摘要

作者用 AI 智能体自动跑完实验，在六个开源模型上验证了 Anthropic 之前闭源论文里的 J-space 现象。简单说，模型的中间层确实存着一本“方向词典”——往残差流里注入某个方向，就能稳定地让模型说出对应的词。实验测了六个维度：一次干预能影响多远（时间跨度）、这个结构在训练中何时出现、不同模型间能否移植、规模变大后怎么变化、对训练语料的依赖程...

## 推荐理由

用 AI 智能体自动复现闭源论文的 J-space，在六个开源模型上跑完六个维度的实验，还给了交互图表和具体数字。作者自己说不是专家，实验设计可能有坑，这点先别太激动，但整体信息量和验证价值够高，值得推荐。

## 锐评

这篇博客最值得看的是它把 Anthropic 闭源论文里的“方向词典”搬到了开源模型上验证。简单说，模型中间层确实存着一套稳定的方向，往残差流里注入某个方向，就能让模型稳定说出对应的词。实验测了六个维度：一次干预能影响多远、这个结构在训练中何时出现、不同模型间能否移植、规模变大后怎么变化、对训练语料的依赖程度，以及混合专家模型里的表现。

但要注意，所有实验都是由 AI 智能体（Fable）自主设计并跑完的，作者 Elie 本人明确说“我不是这个领域的专家”，实验设计和思路可能不完全靠谱。他花了一些时间理解结果、来回调整可视化，但整体严谨性比不上专业团队的手工验证。数据和方法全开源了，如果你自己懂这块，可以直接拿原始结果文件重新算一遍。

目前缺的是更细粒度的因果验证——比如这些方向在不同任务、不同上下文里是否依然稳定，以及小模型上的发现能不能线性外推到超大模型。这些作者没做，正文也没披露。
