# Anthropic 发了篇论文，能让你看到 Gemma 3 生成每个词时在想什么

> 原标题：You can now read Gemma 3's mind

- 来源：r/LocalLLaMA
- 发布时间：2026-05-08T01:44:22.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15644
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t6u1os/you_can_now_read_gemma_3s_mind/

## 摘要

Anthropic 用他们做可解释性的 NLA 方法，把 Gemma 3 27B Instruct 模型内部激活值翻译成人能看懂的概念。具体做法是训练了两个小模块：一个叫 Auto Verbalizer，负责把神经元活动映射到自然语言描述；另一个叫 Activation Reconstructor，用这些描述去重建原始激活，验证解释靠不靠谱。权重已经挂...

## 推荐理由

Anthropic 这次没发新模型，而是给 Gemma 3 27B 做了一次“脑部扫描”。他们用自然语言来解释模型生成单个 token 时的激活模式，相当于把模型决策摊开给你看。两套权重都挂在 Hugging Face 上，Neuronpedia 也上了交互页，上手门槛很低。不过正文没给任何评测分数，所以效果到底多准、解释会不会自说自话，这点先别太激动。整体属于扎实的可解释性开源发布，对关心推理成本和模型行为的人挺有用。

## 锐评

Anthropic 用他们做可解释性的 NLA 方法，给 Gemma 3 27B Instruct 模型装了个“读心术”插件。具体来说，他们训练了两个小模块：一个叫 Auto Verbalizer，负责把模型内部神经元的激活值翻译成自然语言描述，比如模型在生成某个词时，哪些神经元在“想”什么；另一个叫 Activation Reconstructor，用这些描述去重建原始激活值，验证解释靠不靠谱。权重已经挂在 Hugging Face 上，Neuronpedia 也做了个交互页面，你可以直接去看模型生成每个 token 时内部在“说”什么。

这件事的价值在于，它把黑箱打开了一条缝，而且用的是谷歌的模型，不是 Anthropic 自家的 Claude，说明这套方法有一定通用性。但正文没给出解释的准确率或重建误差，也没说这套解释在多大程度上能反映模型真实的决策逻辑。我会先打个折：能读到的“想法”可能只是模型行为的一种近似描述，离真正理解模型推理还有距离。另外，27B 的模型不算小，这套工具对本地部署的硬件要求不低，普通玩家想跑起来可能有点吃力。
