# 用 4B 小模型搭了个编程助手，跑分冲到 87%，作者把方法全摊开了

> 原标题：I built a coding agent that gets 87% on benchmarks with a 4B parameter model, here's how

- 来源：r/LocalLLaMA
- 发布时间：2026-05-18T06:38:11.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/22461
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tgecrq/i_built_a_coding_agent_that_gets_87_on_benchmarks/

## 摘要

作者用 Gemma 4 的 4B 参数模型做了一个叫 SmallCode 的编程 agent，在 100 道题的基准测试里解出了 87 道。核心不是模型本身，而是给模型配了一套复合工具：写完代码自动编译、跑 lint 检查，出错就根据报错信息改；同一个任务连续失败两次后，会自动把问题拆成更小的子任务再试。遇到实在搞不定的题，还能把任务转给 Claude...

## 推荐理由

这是一篇 Reddit 个人实验帖，不是正式论文。我会先打个折：基准测试的具体身份和复现细节没给全，87 分到底是在哪个测试集上跑的、对比基线是谁，正文没披露。但作者把做法讲得很实在——用复合工具、编译反馈当纠错信号、任务拆解策略，这些工程思路对想自己折腾小模型编程智能体的人有直接参考价值。信息有缺口，但第一手实验的干货够，放在 featured 档合适。

## 锐评

这条帖子的核心卖点是：一个叫SmallCode的编程agent，用Gemma 4的4B参数模型，在100道题的基准测试里解出了87道。作者把功劳归给一套复合工具，而不是模型本身。流程是写完代码自动编译、跑lint，出错就根据报错改；同一个任务连续失败两次，就自动把问题拆成更小的子任务再试；实在搞不定还能转给Claude或OpenAI兜底。

这个87%的数字先别太激动。正文被Reddit的网络策略挡了，我没看到具体用的是哪套基准测试、题目难度分布、以及转给大模型兜底的任务占比。如果兜底比例高，那87%里有多少是4B模型自己啃下来的就要打个问号。另外，工具链的延迟、编译环境的依赖也没披露。

对想在小模型上做coding agent的人，这条思路值得看：用工具反馈和任务拆解来弥补模型能力短板。但缺了测试集和兜底比例，没法判断这个87%的含金量。
