跳到正文
r/LocalLLaMA

这篇论文主张:输入处理用低精度加速,输出生成用高精度保质量

Interesting paper advocates for quantized prefilling and precise decoding

论文 arXiv 2605.20315 提出一个混合精度策略:在预填充阶段用 W4A4 量化,理论上能把输入处理速度提升 4 倍;但解码阶段仍用原始高精度,因为激活值的量化误差会扰动采样出的 token,并在自回归生成中逐步累积,导致输出质量下降。正文没披露具体实验模型和数据集,也没给出实际延迟或吞吐数据,所以这 4 倍目前只是理论估算,实际能省多少还...

推荐理由:这篇论文的卖点是“前段省、后段稳”:预填充用 W4A4 量化,理论上能换来 4 倍加速,解码时再切回高精度,防止误差递归累积把回答搞崩。思路本身挺直接,但正文只给了理论增益,没披露实测吞吐、困惑度变化和具体硬件环境,所以实际能省多少、质量掉多少还不清楚。我会先打个折,等看到实测数据再判断值不值得跟。

读原文 ↗导出 Markdown