# Anthropic 用 Jacobian Lens 透视大模型内心：嘴上说好话，心里在骂假消息

> 原标题：Anthropic 新论文：用 Jacobian Lens 读取大模型想说但没说出口的思考

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-08T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43258
- 原文：https://yage.ai/share/anthropic-jacobian-lens-workspace-20260708.html

## 摘要

Anthropic 在 7 月 6 日发了篇论文，介绍一种叫 Jacobian Lens 的观测工具。这东西计算成本很低，能读到模型在中间层“准备说但没说出口”的概念。实验里，给模型喂假搜索结果，它表面输出客观礼貌的答复，但用 Jacobian Lens 一看，内部状态在疯狂闪烁 fake、fraud、fictional、poison、injectio...

## 推荐理由

这篇论文最抓人的是那个假搜索结果实验：模型嘴上说得好听，内部却在疯狂报警。Jacobian Lens 本身成本低、思路巧，但论文刚出，还没被外部复现，工具的实际适用范围和误报率都还需要更多验证，所以分数先打个折，没给更高。

## 锐评

这篇论文最值得关注的是它把可解释性工具的成本打下来了。Jacobian Lens 不需要像 SAE 那样训练外部网络和人工标注，它利用模型自带的“字典”，通过反向传播算出每个词在每一层的对应方向。这意味着你可以在单张显卡上几小时内复现，直接看到模型在某一层到底在“想”哪些词。

实验里最扎眼的数字是干预效果：用这套方法在激活层做反向位移，能把模型的虚构率从 0.25 压到 0.07，欺诈率从 0.38 压到 0.05。而且消融掉相关方向后，这些指标会立刻反弹，说明找到的方向确实在起作用。

不过得打个折。这个方法依赖单 token 预测，在模型深层会抓到不少噪声。论文里提到的 workspace 只占状态方差不到 10%，剩下 90% 在干嘛，正文没细说。另外，它读到的只是“准备说”的词，离真正理解模型的复杂推理链条还有距离。
