# 让 7B 小模型从自己的错误里学习，HumanEval 正确率从 15% 涨到 68%，跑一次训练只要 3.5 美元

> 原标题：I Let a Small Model Train on Its Own Mistakes. It Reached 80% on HumanEval and Beat GPT-3.5 on Math

- 来源：r/LocalLLaMA
- 发布时间：2026-05-14T22:55:05.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/20727
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tde3m1/i_let_a_small_model_train_on_its_own_mistakes_it/

## 摘要

作者拿 Qwen 2.5 7B 基础模型做实验，先让它自己写代码、自己跑测试，把跑不过的代码和报错信息收集起来，再让它根据报错改出正确版本，这样就自动生成了“错误-修正”配对数据。用这批数据微调后，7B 模型在 HumanEval 上的通过题数从 25 题（约 15%）提升到 112 题（约 68%），数学能力也超过了 GPT-3.5。14B 版本只用...

## 推荐理由

我会先打个折：标题说 80% 但正文是 112/164，约 68%，这点先别太激动。不过 hook 确实抓人——让模型自己写题、自己答、再自己改错，用这些修正对去微调，HumanEval 直接翻几倍。14B 版本只用了 100 对样本、一张 H100 跑一个半小时花 3.50 美元，成本低到可以复现。正文没披露数学 benchmark 的具体名称和完整分数，验证偏弱，但作为单人实验，信息量和可操作性都够。保留 78 分，因为它是单篇 Reddit 帖子，且 80% 的说法和实际数字有出入。

## 锐评

这个实验的思路很直接：让Qwen 2.5 7B先写代码，跑不过就收集报错和错误代码，再让它自己改出正确版本，用这些“错误-修正”配对数据做微调。结果HumanEval从25题（约15%）跳到112题（约68%），数学能力也超过了GPT-3.5。14B版本只用100对数据，在H100上跑95分钟，花费3.5美元。

先打个折：这是个人实验，正文没披露测试集是否与训练数据有重叠，也没说HumanEval的164题是不是全测了。80%这个标题数字和68%的通过率对不上，可能混了其他设定。另外，只比了GPT-3.5，没和同等规模的微调模型对照，说服力有限。

不过思路值得关注。它不需要人工标注，靠模型自己的执行反馈就能生成训练数据，对代码、数学这类有客观对错的场景尤其适用。缺的是多轮迭代的效果、不同基座模型的对比，以及错误类型分布的分析——如果模型只会改语法错误而逻辑错误原地踏步，那上限就很明显了。
