# Transformer 真的需要 Q、K、V 三套投影吗？这篇论文系统测了三种共享方案

> 原标题：Do transformers need three projections? Systematic study of QKV variants

- 来源：Hacker News 首页
- 发布时间：2026-06-04T23:11:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34382
- 原文：https://arxiv.org/abs/2606.04032

## 摘要

这篇 ICML 2026 的论文直接动手试了三种省参数的方案：让 Key 和 Value 共用一套投影（Q-K=V）、让 Query 和 Key 共用（Q=K-V），以及三者全共用（Q=K=V）。后两种会让注意力图变成对称的，作者用 2D 位置编码来打破对称性。实验覆盖了合成任务、图像分类和语言模型，最大跑到 12 亿参数、100 亿 token 的训...

## 推荐理由

这篇 ICML 2026 论文没搞理论推导，直接动手试了三种省投影的方案：Key 和 Value 共用一套（Q-K=V）、Query 和 Key 共用（Q=K-V），以及三者全共用（Q=K=V）。后两种会让注意力图变成对称的，作者用 2D 位置编码来打破对称性。实验从合成任务一路做到 12 亿参数的语言模型，最大跑了 100 亿 token。结果挺实在：Q-K=V 方案在语言模型上几乎不掉点，但 KV 缓存直接砍半，推理成本能省不少。不过这是架构研究，不是落地产品，而且论文里没提法案文本和执行时间表——那部分只是公开信呼吁，还没变成法律。所以放在 ...

## 锐评

这篇 ICML 2026 的论文做了一件很直接的事：把 Transformer 里 Q、K、V 三套投影矩阵试着合并，看能省多少参数、掉多少效果。他们试了三种方案：让 Key 和 Value 共用一套投影（Q-K=V）、让 Query 和 Key 共用（Q=K-V），以及三者全共用（Q=K=V）。后两种会让注意力图变成对称的，作者用 2D 位置编码来打破对称性。

最实用的发现是 Q-K=V 方案。在 12 亿参数、100 亿 token 的语言模型上，它把 KV 缓存直接砍半，困惑度只涨了 3.1%。这个方案还能跟 GQA、MQA 这些多头共享技术叠加：跟 GQA-4 组合省 87.5% 缓存，跟 MQA 组合能省 96.9%。这对端侧部署很友好，因为显存是硬瓶颈。作者解释 Q-K=V 能保住效果，是因为 Key 和 Value 在表示空间上本来就可以很接近，注意力机制又工作在低秩状态。而 Q=K-V 破坏了注意力的方向性，效果就差一些。

不过这篇论文主要报的是困惑度和准确率，没给推理延迟的实测数据。省了缓存不代表推理一定变快，还得看实际部署时的访存和计算开销。另外实验最大只跑到 12 亿参数，更大规模上这些结论能不能站住，正文也没给出验证。
