# 实测：用小模型跑编程 agent，哪些环节会崩

> 原标题：Notes on what actually breaks when you run a coding agent on small local models

- 来源：r/LocalLLaMA
- 发布时间：2026-04-30T10:39:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12212
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1szsdyb/notes_on_what_actually_breaks_when_you_run_a/

## 摘要

作者花了几周时间，用 7B 以下的本地小模型和免费云端模型跑多文件编程任务，发现结构化输出很不靠谱。崩得最多的地方有三个：模型在回复里乱加 markdown 代码块标记，把编辑内容写到错误的文件里，以及分不清该读文件还是写文件。作者给的解法是做后处理清洗和加校验步骤，但正文没披露具体用哪些模型、测试了多少任务，也没给出量化的成功率，所以这些结论只能当经...

## 推荐理由

这篇 Reddit 帖子不是论文，是作者拿 Qwen、Gemma 等小模型实打实跑了几周多文件编程 agent 后的踩坑记录。我会先打个折：它只是单人经验，没有系统对比实验，所以给 75 分。但内容很实在——7B 以下模型连输出格式都稳不住，Markdown 围栏乱加、改错文件、读写成写这类问题反复出现。作者没灌水，直接给了后处理、JSON schema 校验、路径白名单和只读路由这些能落地的补救办法。正文没披露具体模型版本和测试任务量，这点让结论的普适性弱一些，但对想用本地模型搭 coding agent 的人，这些失败模式比 benchmark...

## 锐评

这篇 Reddit 帖子来自一个开发者几周的实战踩坑，核心发现很直白：用 7B 以下的本地小模型做多文件编程 agent，结构化输出基本靠不住。崩盘重灾区有三个：模型在回复里乱塞 markdown 代码块标记，把编辑内容写到错误的文件里，以及分不清该读文件还是写文件。作者给的解法是加后处理清洗和校验步骤，相当于给模型输出擦屁股。

但这里有个关键信息缺口——正文没披露具体用了哪些模型、测试了多少任务，也没给出量化的成功率。所以这些结论只能当经验之谈，不能直接当基准参考。如果你自己试，建议先拿 Qwen 或 Gemma 这类小模型跑几个固定任务，看看格式错误率到底多高，再决定要不要上后处理管线。
