跳到正文
r/LocalLLaMA

本地跑 Qwen 给 Codex 当代码审查员、协作者和挑刺对手的实测

Benching local Qwen as a Codex validator, co-agent, and challenger

robert896r1 把 Qwen3.6 27B 的 GGUF 量化版放在 Codex 旁边当代码校验器,并放出了一套可复现的评测流程。测试覆盖了 Bartowski 和 Unsloth 两种量化来源、65k 和 128k 上下文窗口,以及 q8 和 f16 的 KV 缓存精度。三个 128k 上下文的配置并列最佳,在这个评测套件里没测出 q8 KV...

推荐理由:我会先打个折:这不是官方发布,是一个个人实测套件,样本量和覆盖面有限。但它的价值不在权威性,而在把 Qwen 塞进一个贴近真实开发的 sidecar eval 里——测的是漏指令、过度实现、UI 判断和长上下文遗漏,不是跑分。三个 128k profile 并列最佳,q8 KV 没翻车,这点对想省显存的人挺实用。正文没披露 Codex 的具体版本和调用方式,也没给错误分布,所以别当严谨 benchmark 用,更适合当一份本地部署的参考起点。

读原文 ↗导出 Markdown