# Qwen 3.8-27B 的 4-bit 量化版调两个参数后，跑分反超 Q5 量化并逼近官方满血版

> 原标题：Qwen 3.8-27B NVFP4 actually beats Q5_K_M and touches official BF16 levels, but only if you change 2 sampling params. Also almost 3x faster.

- 来源：r/LocalLLaMA
- 发布时间：2026-09-06T17:34:29.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55125
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1w92jg7/qwen_3827b_nvfp4_actually_beats_q5_k_m_and/

## 摘要

一位老哥在 5090 上对比了 Qwen 3.8-27B 的两种本地运行方式：用 NInfer 跑的 NVFP4（4-bit 量化）和用 llama.cpp 跑的 Q5_K_M。一开始用默认采样参数（temp=1.0, min_p=0.0）跑 IFBench 指令遵循测试，Q5 严格分 76% 略高于 NVFP4 的 74%。但他发现 NVFP4 的宽...

## 推荐理由

这是一篇单人单卡、单模型的实测笔记，不是纸上谈兵。作者发现NVFP4默认参数下指令遵循能力被压住了，调参后直接反超更高比特的量化方案，还附了速度对比。我会先打个折：测试只在一张5090上跑了一个模型，依赖NInfer这个相对小众的推理引擎，普适性有限。但文章的价值在于给出了一个具体、可复现的调参思路，对本地部署党来说比泛泛的量化对比报告有用得多。

## 锐评

这条发现挺反直觉的：4-bit 量化模型在默认采样下看起来比 Q5 差，但问题出在采样太“吵”，导致格式小毛病多，而不是模型笨。作者把温度从 1.0 降到 0.9，min_p 从 0 提到 0.05，NVFP4 的严格指令遵循得分直接从 74% 跳到 80%，而 Q5_K_M 纹丝不动停在 76%。这说明 Q5 的错是真错，NVFP4 的错是能修好的格式漂移。

不过得先打个折。作者只测了 50 个样本，官方 BF16 跑 300 个样本是 79.5%，他本地 80% 的成绩有样本波动，不能直接说 4-bit 超越了全精度。但能逼近到这种程度，同时显存占用大降、速度翻近三倍，对本地跑大模型的用户来说很实用。

正文没披露 Q5_K_M 的具体量化细节和显存占用对比，也没说这套采样参数在其他任务上是否同样有效。如果只测了指令遵循这一个维度，结论的普适性还得再验证。
