Qwen 3.8-27B 的 4-bit 量化版调两个参数后,跑分反超 Q5 量化并逼近官方满血版
Qwen 3.8-27B NVFP4 actually beats Q5_K_M and touches official BF16 levels, but only if you change 2 sampling params. Also almost 3x faster.
一位老哥在 5090 上对比了 Qwen 3.8-27B 的两种本地运行方式:用 NInfer 跑的 NVFP4(4-bit 量化)和用 llama.cpp 跑的 Q5_K_M。一开始用默认采样参数(temp=1.0, min_p=0.0)跑 IFBench 指令遵循测试,Q5 严格分 76% 略高于 NVFP4 的 74%。但他发现 NVFP4 的宽...
推荐理由:这是一篇单人单卡、单模型的实测笔记,不是纸上谈兵。作者发现NVFP4默认参数下指令遵循能力被压住了,调参后直接反超更高比特的量化方案,还附了速度对比。我会先打个折:测试只在一张5090上跑了一个模型,依赖NInfer这个相对小众的推理引擎,普适性有限。但文章的价值在于给出了一个具体、可复现的调参思路,对本地部署党来说比泛泛的量化对比报告有用得多。