# 苹果把 Transformer 改成了 Mamba，推理成本从平方级压到线性

> 原标题：Transformer可以改装成Mamba了：苹果把推理成本直接打成线性

- 来源：机器之心 · 公众号
- 发布时间：2026-04-22T03:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/8958
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651029279&idx=2&sn=5a0e44d0677bd29c08923906bf7ba28d

## 摘要

苹果发了一篇技术文章，讲怎么把一个训好的 Transformer 模型（Pythia-1B）蒸馏成 Mamba 架构，让推理时的计算量从平方级降到线性。他们没直接硬蒸，因为直接蒸效果会崩（困惑度直接飙到 100 以上）。实际分了两步：先把 Transformer 的注意力换成一种叫 Hedgehog 的线性注意力，让模型适应线性计算；再把这个中间模型映...

## 推荐理由

我会先打个折：这还是个论文结果，不是已经落地的产品。但路线本身有意思——不是从头训 Mamba，而是把现成的 Transformer 蒸馏过去，省了大量训练成本。正文给出的下游任务（ARC、PIQA、BoolQ 等）说接近教师，但没放具体数字，这点先别太激动。如果真能在长上下文场景把推理成本压到线性，对需要处理长文档或长对话的产品是实打实的省钱。

## 锐评

苹果这篇技术文章讲的是架构迁移，不是新模型发布。他们把 Pythia-1B 这个 Transformer 模型蒸馏成 Mamba 架构，核心收益是推理时的计算量从平方级降到线性，长文本场景下能省不少钱。但直接蒸行不通，困惑度会飙到 100 以上，基本等于废了。他们的解法分两步：先把 Transformer 的注意力换成一种叫 Hedgehog 的线性注意力，让模型先适应线性计算；再把这个中间模型映射到 Mamba 架构初始化，最后微调。最终用大约 2.7% 的原始训练数据（100 亿 token）把困惑度压到 14.11，跟原版 Transformer 的 13.86 很接近了。

下游任务分数（ARC、PIQA、BoolQ、RACE、LogiQA）也接近原版，说明能力没丢太多。但正文没披露长序列实际推理延迟或吞吐量的对比数字，也没说这个方法在更大规模模型上能不能复用。1B 参数量的验证规模偏小，换到 7B 或更大模型时，线性注意力的中间适配阶段会不会引入新的性能折损还不清楚。这点先别太激动，等更大规模的复现结果出来再看。
