在六个开源模型上复现 J-space:中间层藏着一本可操控输出的方向词典
J-space comparisons across open models
作者用 AI 智能体自动跑完实验,在六个开源模型上验证了 Anthropic 之前闭源论文里的 J-space 现象。简单说,模型的中间层确实存着一本“方向词典”——往残差流里注入某个方向,就能稳定地让模型说出对应的词。实验测了六个维度:一次干预能影响多远(时间跨度)、这个结构在训练中何时出现、不同模型间能否移植、规模变大后怎么变化、对训练语料的依赖程...
推荐理由:用 AI 智能体自动复现闭源论文的 J-space,在六个开源模型上跑完六个维度的实验,还给了交互图表和具体数字。作者自己说不是专家,实验设计可能有坑,这点先别太激动,但整体信息量和验证价值够高,值得推荐。