# Kimi Linear：混合线性注意力架构，首次在公平对比下跑赢标准注意力

> 原标题：Kimi Linear: An Expressive, Efficient Attention Architecture

- 来源：Hacker News 首页
- 发布时间：2026-07-28T10:52:30.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47137
- 原文：https://arxiv.org/abs/2510.26692

## 摘要

月之暗面 Kimi 团队发了一篇技术报告，提出 Kimi Linear 这个混合线性注意力架构。核心是一个叫 Kimi Delta Attention（KDA）的模块，它在 Gated DeltaNet 基础上加了更细粒度的门控，让有限的 RNN 记忆用得更高效。他们训了一个总参数 48B、激活 3B 的 MoE 模型，把 KDA 和多头隐式注意力（M...

## 推荐理由

月之暗面这次没发产品，发的是架构论文，Kimi Linear把线性注意力和MoE揉在一起，48B总参、3B激活的模型在长上下文和推理上表现不错。KDA的门控设计让RNN记忆用得更省，这点挺巧。不过目前只是arxiv预印本，没有产品落地时间表，实际效果还得看社区复现和第三方评测，所以分数先打个折，不往更高给。

## 锐评

这篇技术报告的核心看点不是“又出了一个线性注意力”，而是他们第一次在公平对比下，让线性注意力在短文本、长文本和强化学习扩展上都超过了传统的全注意力。Kimi Linear 是个混合架构，把新设计的 Kimi Delta Attention（KDA）和多头隐式注意力（MLA）混在一起用。KDA 在 Gated DeltaNet 基础上加了更细粒度的门控，让 RNN 那点有限的记忆用得更聪明。他们训了一个总参数 48B、激活 3B 的 MoE 模型来验证，KV 缓存最多能砍掉 75%，处理百万 token 上下文时解码吞吐量是纯 MLA 的 6 倍。

不过得注意，这些数据来自他们自己的训练配方和评测集，换一套训练数据或任务分布是否还能稳住，正文没给消融实验。另外，线性注意力在需要精确位置信息的任务上容易丢细节，这篇报告没专门测这类场景的退化程度。

团队把 KDA 的 CUDA 核、vLLM 集成和模型权重都开源了，这点挺实在，后续能不能在社区里跑通更多场景，比论文里的数字更有说服力。
