跳到正文
r/LocalLLaMA

Shard:把 KV 缓存压到原来的十分之一,长上下文推理更省显存

Shard - getting to 10× KV cache compression

Shard 这套方法能在 Llama-3.1-8B 上把 KV 缓存占的显存砍掉约 90%。具体来说,8K 上下文长度时压缩比约 10 倍,拉到 32K 时能到 11 倍。技术路线分两路:对 Key 矩阵先用 PCA 降维再做 int4 量化,对 Value 矩阵则用 Hadamard 旋转配合向量量化。论文在 NIAH 和 LongBench 两个基...

推荐理由:HKR 三项都站得住:10 倍 KV 缓存压缩是个好钩子,数字和模型、上下文长度、基准测试都列清楚了。信息目前只来自 Reddit 帖子,验证有限,所以分数压在 78–84 这个区间。正文没提压缩方法的具体实现和额外计算开销,这点先别太激动,等有人复现再说。

读原文 ↗导出 Markdown