KV 缓存量化实测:TurboQuant 被高估,q5 值得多看两眼,对称 q8 可能白占显存
Here are my KV cache quantization benchmarks: TurboQuant is overrated but saved by TCQ, q5 deserves more attention, and symmetric q8 might be a waste of VRAM
Anbeeld 用一张 RTX 3090 跑 Qwen 3.6 27B,在 64k 和 128k 上下文长度下测了 KV 缓存量化。先说结论:q4_0 在尾部 token 上的 KLD 比 q5_0 差了 32%,精度掉得明显;turbo4 比普通 q4_0 还慢 17%,显存却没省下多少,有点名不副实。q5_0 在精度和压缩率之间平衡得不错,但正文没...
推荐理由:我会先打个折:这篇测试只跑了一张 RTX 3090 和一个模型,结论不能直接套到其他卡或模型上。但它的好处是给了具体数字,比如 q4_0 在长上下文时尾部偏差比 q5_0 高 32%,turbo4 反而比 q4_0 慢 17%,对称 q8 可能白占显存。这些发现对玩本地推理的人有参考价值,不是泛泛而谈的评测。正文没披露更多硬件或复现细节,所以先别太激动,但作为社区一手数据,值得推给关注推理优化的人看一眼。