# 本地跑 Qwen 给 Codex 当代码审查员、协作者和挑刺对手的实测

> 原标题：Benching local Qwen as a Codex validator, co-agent, and challenger

- 来源：r/LocalLLaMA
- 发布时间：2026-05-04T21:58:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13687
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t3w4xc/benching_local_qwen_as_a_codex_validator_coagent/

## 摘要

robert896r1 把 Qwen3.6 27B 的 GGUF 量化版放在 Codex 旁边当代码校验器，并放出了一套可复现的评测流程。测试覆盖了 Bartowski 和 Unsloth 两种量化来源、65k 和 128k 上下文窗口，以及 q8 和 f16 的 KV 缓存精度。三个 128k 上下文的配置并列最佳，在这个评测套件里没测出 q8 KV...

## 推荐理由

我会先打个折：这不是官方发布，是一个个人实测套件，样本量和覆盖面有限。但它的价值不在权威性，而在把 Qwen 塞进一个贴近真实开发的 sidecar eval 里——测的是漏指令、过度实现、UI 判断和长上下文遗漏，不是跑分。三个 128k profile 并列最佳，q8 KV 没翻车，这点对想省显存的人挺实用。正文没披露 Codex 的具体版本和调用方式，也没给错误分布，所以别当严谨 benchmark 用，更适合当一份本地部署的参考起点。

## 锐评

这条帖子的核心玩法是把 Qwen3.6 27B 的量化版（GGUF 格式）放在 Codex 旁边当“代码校验器”，专门抓漏掉的指令、过度开发、UI 判断失误和长上下文遗漏。作者 robert896r1 放出了一套可复现的评测流程，对比了 Bartowski 和 Unsloth 两种量化来源、65k 和 128k 上下文窗口，以及 q8 和 f16 的 KV 缓存精度。结果三个 128k 配置并列最佳，在这个套件里 q8 KV 缓存没测出精度损失。

但这里有个硬伤：Reddit 原文返回了 403，正文内容被网络屏蔽，我们只能看到摘要。摘要里没提具体测试了多少个任务、每个任务跑了几次、Codex 本身的表现基线是多少。128k 并列最佳这个结论，也不知道是跑分接近还是真的没差别。另外，27B 模型在本地跑的实际延迟和显存占用也没给，这对想复现的人来说是个关键缺口。

整体看，这个“旁路评测”的思路比通用排行榜更有参考价值，因为它直接模拟了一个真实工作流：大模型写代码，小模型在旁边挑刺。但信息缺口太大，结论先打个七折。
