# 这篇论文主张：输入处理用低精度加速，输出生成用高精度保质量

> 原标题：Interesting paper advocates for quantized prefilling and precise decoding

- 来源：r/LocalLLaMA
- 发布时间：2026-05-21T19:42:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/25397
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tjvl4h/interesting_paper_advocates_for_quantized/

## 摘要

论文 arXiv 2605.20315 提出一个混合精度策略：在预填充阶段用 W4A4 量化，理论上能把输入处理速度提升 4 倍；但解码阶段仍用原始高精度，因为激活值的量化误差会扰动采样出的 token，并在自回归生成中逐步累积，导致输出质量下降。正文没披露具体实验模型和数据集，也没给出实际延迟或吞吐数据，所以这 4 倍目前只是理论估算，实际能省多少还...

## 推荐理由

这篇论文的卖点是“前段省、后段稳”：预填充用 W4A4 量化，理论上能换来 4 倍加速，解码时再切回高精度，防止误差递归累积把回答搞崩。思路本身挺直接，但正文只给了理论增益，没披露实测吞吐、困惑度变化和具体硬件环境，所以实际能省多少、质量掉多少还不清楚。我会先打个折，等看到实测数据再判断值不值得跟。

## 锐评

这篇论文的思路挺直接：把模型处理输入（预填充）和生成输出（解码）分开对待。预填充阶段用 W4A4 量化，也就是把权重和激活值都压到 4 比特，理论上能把输入处理速度提 4 倍。但一到解码阶段，就老老实实切回原始高精度。原因是解码时激活值的量化误差会带偏采样出的 token，而且这种偏差会在自回归生成中一步步累积，最后把输出质量拉低。

不过得说清楚，这 4 倍提速目前只是纸面估算。正文没披露用了什么模型、什么数据集做的验证，也没给出实际的延迟或吞吐数据。所以到底能省多少算力、对最终生成效果影响多大，都还是未知数。另外，这种混合精度策略在工程上怎么无缝切换，推理框架支不支持，论文也没展开。

对跑本地模型的人来说，如果后续有实测数据撑腰，这确实是个省资源的思路。但现在先别太激动，等有人复现出具体数字再说。
