跳到正文
Hugging Face 博客

Multiverse 搞了个“量化感知修复术”,让 4-bit 压缩模型跑赢了原版全精度模型

Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

Multiverse Computing 提出了一种叫“量化感知修复(QAH)”的方法,专门用来抢救那些先被砍掉一半参数、再被压到 4-bit 的模型。他们拿 GPT-OSS 120B 开刀,先剪枝到 60B,再量化成 MXFP4,然后用 QAH 修复。结果这个 4-bit 的小模型在 9 项基准测试里有 7 项反超了 bfloat16 的原版,尤其在...

推荐理由:一个 4-bit 模型在多数测试里打赢了原版全精度模型,这个结果本身就够反常识。方法叫 QAH,专门修复先剪枝再量化的模型,拿 GPT-OSS 120B 砍到 60B 再压成 MXFP4 做验证,9 项基准赢了 7 项,数字很直观。我会先打个折:正文没披露修复阶段用了多少额外算力、数据,也没说剩下 2 项输了多少,复现条件不透明。所以重要性给到 78,够上 featured,但离必转还差一口气。

读原文 ↗导出 Markdown