# Shard：把 KV 缓存压到原来的十分之一，长上下文推理更省显存

> 原标题：Shard - getting to 10× KV cache compression

- 来源：r/LocalLLaMA
- 发布时间：2026-05-26T04:04:03.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/27090
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tnvo7r/shard_getting_to_10_kv_cache_compression/

## 摘要

Shard 这套方法能在 Llama-3.1-8B 上把 KV 缓存占的显存砍掉约 90%。具体来说，8K 上下文长度时压缩比约 10 倍，拉到 32K 时能到 11 倍。技术路线分两路：对 Key 矩阵先用 PCA 降维再做 int4 量化，对 Value 矩阵则用 Hadamard 旋转配合向量量化。论文在 NIAH 和 LongBench 两个基...

## 推荐理由

HKR 三项都站得住：10 倍 KV 缓存压缩是个好钩子，数字和模型、上下文长度、基准测试都列清楚了。信息目前只来自 Reddit 帖子，验证有限，所以分数压在 78–84 这个区间。正文没提压缩方法的具体实现和额外计算开销，这点先别太激动，等有人复现再说。

## 锐评

这篇帖子介绍的方法叫 Shard，在 Llama-3.1-8B 上把 KV 缓存占的显存压到原来的十分之一左右。8K 上下文时压缩比约 10 倍，拉到 32K 能到 11 倍，而且论文声称在 NIAH 和 LongBench 两个基准上没掉分。技术路线分两条：Key 矩阵先用 PCA 降维再 int4 量化，Value 矩阵用 Hadamard 旋转配合向量量化。思路不新，但组合起来效果看着不错，尤其对本地跑大模型的玩家来说，显存省下来就能塞更长上下文或者跑更大 batch。

不过这条信息有个硬伤：Reddit 原文被网络策略挡了，返回 403，我们拿不到完整论文和实验细节。压缩比 10 倍是峰值还是均值、不同层之间差异多大、解码速度有没有拖慢、int4 量化后精度损失在哪些任务上会暴露，这些正文都没披露。另外 NIAH 和 LongBench 主要测检索和长文本理解，对生成质量、推理链路的压力不够，不能直接等同于“无损”。

我会先给这个结果打个七折。方法本身有参考价值，但没看到代码和权重之前，别急着往生产环境搬。如果你手上有能访问原文的渠道，重点看三件事：压缩后的解码延迟、不同任务上的 PPL 变化、以及是不是只对 8B 这个规模有效。
