把大模型当外星生物解剖,这群人发现了什么
Meet the new biologists treating LLMs like aliens
MIT Technology Review 报道了 Anthropic、OpenAI 和 Google DeepMind 正在用“机械可解释性”研究大模型内部机制。打个比方,一个 2000 亿参数的模型用 14 号字打印出来,能铺满 46 平方英里,差不多整个旧金山市区。Anthropic 用稀疏自编码器做了一个更透明的替身模型来模仿目标模型,2024...
推荐理由:这篇不是常规研究复述,而是用“外星生物学”的比喻把机理可解释性讲透了。我会先打个折:它不是新模型发布或单一突破,而是高质量的报道式综述,但给出的稀疏自编码器、金门大桥特征、香蕉颜色路径这几个例子够具体,能让做对齐和安全的人停下来想一想。正文没披露这些发现的复现规模和泛化边界,所以别太激动,但它确实把“模型内部缺稳定心智”这个约束摆到了台面上。