华为开源 KVarN:KV 缓存压缩 3 到 5 倍,推理反而更快,不是减速
KVarN: new KV-cache quant from Huawei. 3–5× KV cache compression with actual speed-up instead of slow-down, and unlike TurboQuant it holds up on reasoning (Apache 2.0, vLLM single flag)
华为放出了一个叫 KVarN 的 KV 缓存量化方法,Apache 2.0 协议,已经能通过一个开关直接跑在 vLLM 上。它能把存上下文的那块显存压到原来的 1/3 到 1/5,吞吐量最高比 FP16 还快 40%。和之前的 TurboQuant 不一样,它在推理任务上不会崩。不需要改模型、不用重新训练、也不用校准数据。不过帖子正文被 Reddit ...
推荐理由:HKR 全过:钩子够具体,正文给了压缩比、吞吐和接入方式,对做推理部署的人省钱省资源。但这是一封公开信和政策呼吁,不是已生效的法律,法案文本和执行时间表都没披露,所以放在 featured 而不是更高档位。