# 有人复现了 TurboQuant，结果跟论文对不上

> 原标题：Implemented TurboQuant and results don’t fully match paper

- 来源：r/LocalLLaMA
- 发布时间：2026-05-02T20:05:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12999
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t208qv/implemented_turboquant_and_results_dont_fully/

## 摘要

一位 Reddit 用户自己实现了 TurboQuant 这篇 KV 缓存量化方法，发现 PROD 变体在 4-bit 下跟原始精度结果的相关性大约 95.8%，远低于论文宣称的 99% 以上。作者还做了一个简单模拟，注意力质量的 top-1 准确率掉到了 67% 左右，说明量化后模型在“该关注哪个 token”这件事上退化明显。核心矛盾在于：论文用相...

## 推荐理由

这是 Reddit 上的单次复现，不是正式论文或官方发布，但 95.8% 的相关性和约 67% 的 top-1 准确率这两个数字挺具体，对正在掂量 KV cache 量化方案的人有参考价值。我会先打个折，因为样本量和测试条件正文没披露，结论不能直接当定论。

## 锐评

这条帖子直接打在了 TurboQuant 论文最核心的卖点上。作者自己动手实现了 PROD 变体，在 4-bit 量化下跟原始精度的相关性只有 95.8%，而论文宣称的是 99% 以上。这个差距不小，说明论文里的好成绩可能依赖了特定实验设置，换个环境就不一定复现得出来。

更关键的是作者做了一个简单模拟，看量化后的模型在“该关注哪个 token”这件事上还剩多少准头，结果 top-1 准确率掉到了 67% 左右。这个数字很直观：注意力机制是模型做判断的基础，基础歪了，后面生成的质量很难不受影响。帖子点出了一个根本矛盾——论文用相关性当指标，但相关性高不代表排序保得住，而注意力质量恰恰看的是排序。

不过要冷静看待：这是单人复现，正文没披露用的什么模型、什么任务、模拟的具体设置，也没说是不是跟论文完全一样的实验条件。如果作者能把代码和完整配置放出来，社区交叉验证一下，这个结论会硬得多。
