# Multiverse 搞了个“量化感知修复术”，让 4-bit 压缩模型跑赢了原版全精度模型

> 原标题：Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original

- 来源：Hugging Face 博客
- 发布时间：2026-08-25T11:39:24.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53847
- 原文：https://huggingface.co/blog/MultiverseComputingCAI/quantization-aware-healing

## 摘要

Multiverse Computing 提出了一种叫“量化感知修复（QAH）”的方法，专门用来抢救那些先被砍掉一半参数、再被压到 4-bit 的模型。他们拿 GPT-OSS 120B 开刀，先剪枝到 60B，再量化成 MXFP4，然后用 QAH 修复。结果这个 4-bit 的小模型在 9 项基准测试里有 7 项反超了 bfloat16 的原版，尤其在...

## 推荐理由

一个 4-bit 模型在多数测试里打赢了原版全精度模型，这个结果本身就够反常识。方法叫 QAH，专门修复先剪枝再量化的模型，拿 GPT-OSS 120B 砍到 60B 再压成 MXFP4 做验证，9 项基准赢了 7 项，数字很直观。我会先打个折：正文没披露修复阶段用了多少额外算力、数据，也没说剩下 2 项输了多少，复现条件不透明。所以重要性给到 78，够上 featured，但离必转还差一口气。

## 锐评

Multiverse Computing 搞了个叫“量化感知修复”（QAH）的方法，专门给那些先剪枝再量化的模型做性能抢救。他们拿 GPT-OSS 120B 开刀，先砍掉一半参数变成 60B，再压成 MXFP4 格式，最后用 QAH 修复。结果这个 4-bit 小模型在 9 项基准测试里，有 7 项反超了 bfloat16 的原版，尤其在推理和数学题上表现更好。

这个结果挺反直觉的，相当于把书撕掉一半、字迹再弄模糊，最后读起来反而更通顺了。但先别太激动。文章只比了跑分，完全没提推理速度和显存占用这些实际部署最关心的指标。没有延迟和吞吐数据，就没法判断这 4-bit 模型到底能省多少硬件成本。另外，测试只在一款模型上做了验证，换到其他架构上效果会不会打折，正文也没交代。
