# 把大模型当外星生物解剖，这群人发现了什么

> 原标题：Meet the new biologists treating LLMs like aliens

- 来源：MIT Technology Review · AI
- 发布时间：2026-01-12T11:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3862
- 原文：https://www.technologyreview.com/2026/01/12/1129782/ai-large-language-models-biology-alien-autopsy/

## 摘要

MIT Technology Review 报道了 Anthropic、OpenAI 和 Google DeepMind 正在用“机械可解释性”研究大模型内部机制。打个比方，一个 2000 亿参数的模型用 14 号字打印出来，能铺满 46 平方英里，差不多整个旧金山市区。Anthropic 用稀疏自编码器做了一个更透明的替身模型来模仿目标模型，2024...

## 推荐理由

这篇不是常规研究复述，而是用“外星生物学”的比喻把机理可解释性讲透了。我会先打个折：它不是新模型发布或单一突破，而是高质量的报道式综述，但给出的稀疏自编码器、金门大桥特征、香蕉颜色路径这几个例子够具体，能让做对齐和安全的人停下来想一想。正文没披露这些发现的复现规模和泛化边界，所以别太激动，但它确实把“模型内部缺稳定心智”这个约束摆到了台面上。

## 锐评

这篇报道讲的是几大 AI 实验室正在用“机械可解释性”拆解大模型，方法很像生物学家解剖外星人。他们不把模型当代码看，而是当成一个长出来的活物去观察。文章给了一个很直观的尺度感：一个 2000 亿参数的模型用 14 号字打印出来，能铺满 46 平方英里，差不多整个旧金山市区。这个数字说明我们面对的已经不是传统软件，而是一个人类脑子根本装不下的复杂系统。

Anthropic 的做法是训练一个稀疏自编码器，相当于给原模型做一个更透明的替身，然后通过替身去反推原模型内部在干什么。2024 年他们成功把 Claude 3 Sonnet 里某个区域跟“金门大桥”这个概念对应上，今年 7 月又发现模型处理“香蕉是黄的”和“香蕉是红的”时激活了不同的内部路径。这至少证明模型内部不是一团浆糊，有可辨认的结构。但正文没披露这种方法的覆盖率和误判率，也没说能解释的参数占比有多大。OpenAI 和 Google DeepMind 的具体进展同样没展开，只提了他们在做类似的事。

对从业者来说，这条线索的价值在于：如果模型内部一致性弱，对齐和可预测性就无从谈起。但目前这些发现还停留在“看到了几个零件”的阶段，离“看懂整台机器”差着好几个数量级。还缺的是更大规模验证、跨模型对比，以及这些内部路径跟实际输出错误之间的因果关系证据。
