# 同一个 9B Qwen 模型，换套脚手架，Aider 编程得分从 19.1% 跳到 45.6%

> 原标题：Same 9B Qwen weights: 19.1% in Aider vs 45.6% with a scaffold adapted to small local models

- 来源：r/LocalLLaMA
- 发布时间：2026-04-19T14:27:33.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/6436
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1spufzz/same_9b_qwen_weights_191_in_aider_vs_456_with_a/

## 摘要

作者拿 Qwen3.5-9B 的 Q4 量化版跑 Aider 的多语言编程基准（225 道题），只换了调用模型的外层脚手架，平均 pass@2 就从 19.11% 拉到了 45.56%。这个叫 little-coder 的脚手架不是新模型，它做了几件事：限制推理步数、加写文件前的安全锁、让模型主动扫描工作区文件，以及每轮塞一点针对性技能提示。核心观点是...

## 推荐理由

我会先打个折：证据确实薄，只有两次完整运行，没做消融也没换模型复现，所以别急着当结论用。但 hook 很实在——同一套 9B 权重，只靠 scaffold 设计就把 Aider 成绩翻了一倍多，说明 scaffold 和模型的匹配度可能比模型本身还关键。作者列出的四个机制（受限推理预算、拒绝覆盖已有文件的 Write guard、显式工作区发现、按轮注入小技能）也给了可复现的线索。对正在折腾本地小模型做代码 agent 的团队，这篇值得看一眼思路，但暂时别拿 45.6% 当稳定预期。

## 锐评

这条帖子最值得看的地方是：模型没变，只换了外面的调用框架，Aider 编程基准的 pass@2 就从 19.11% 拉到了 45.56%。little-coder 这个脚手架做了几件很实际的事——限制推理步数、写文件前加安全锁、让模型主动扫工作区文件、每轮塞一点针对性技能提示。说白了就是给 9B 小模型配了一套更适配的操作流程，而不是让它裸跑通用基准。

但得打几个折。作者只报告了两次完整跑分，没有做消融实验，也没在别的模型或第二个基准上复现。这意味着我们不知道是哪个改动贡献最大，也不知道换一个模型这套脚手架还灵不灵。正文也没披露推理步数限制的具体值、安全锁的实现细节，以及技能提示是怎么选的。

对本地跑小模型的人来说，这条信息有用但验证太弱。如果你手头有 9B 级别的模型，可以拿 little-coder 的思路试试，但别指望一定翻倍。等有人用不同模型、不同基准交叉验证过，这个数字才值得当真。
