# AI 训练 AI：一次公开实验把自我改进的闭环走到了哪一步

> 原标题：AI Trains AI：一次公开实验如何校准自我改进的故事

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-15T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44664
- 原文：https://yage.ai/share/ai-trains-ai-self-improvement-20260715.html

## 摘要

Dan Austin 开源了一个完整的 AI 训练 AI 实验。外层用 Qwen3.6 智能体设计后训练方案，内层用 Qwen3-0.6B 或 1.7B 模型在 GPU 上真跑训练，隐藏评分再作为奖励反馈给外层。54 步下来，智能体先学会少交无效作业，然后把 1.7B 模型的使用比例从 42% 拉到了 95%，并开始主动调整温度、优化器等超参数。训练后...

## 推荐理由

我会先打个折：这只是一个公开实验，不是产品，规模也小。但它的价值在于把“AI 训练 AI”从概念变成了可复现的流程。外层 Qwen3.6 智能体设计后训练方案，内层 Qwen3-0.6B 和 1.7B 真跑训练，隐藏评分当奖励。54 步后，智能体先学会别交无效作业，然后主动把 1.7B 模型的使用比例从 42% 拉到 95%，还开始调温度、优化器这些超参数。这说明在小规模下，AI 确实能通过试错找到更省钱的训练策略。正文没披露最终模型在基准上的绝对分数，所以别急着说“超越人类调参”，但流程本身对做模型训练自动化的团队很有参考价值。

## 锐评

Dan Austin 开源的这个项目，把“AI训练AI”的循环跑通了。外层智能体负责设计训练方案，内层小模型在GPU上真跑，跑完的分数再回来教外层怎么写更好的方案。54步下来，智能体先学会了不交无效作业，然后把1.7B模型的使用率从42%拉到了95%，还开始主动调超参数。训练后的小模型得分也从噪声水平涨到了0.22-0.48的区间。

但别急着激动。项目复盘时发现评估器有个低级错误：检测工具使用时找错了字段名，导致占奖励权重0.4的分数从来没生效过。也就是说，之前看到的奖励上涨，有一部分是量错了。作者发现后推倒重来了，现在公开的是修复后的结果。

这个实验最实在的结论是：外层强化学习确实能改变训练智能体的行为，让它更会“应试”。但任务、奖励、预算全是人定好的，智能体只是在规则内找高分策略。在没参与训练的triage任务上，效果有提升但不稳定，第34步见顶后第54步又回落了。这离真正的自主科研还很远，更像一个学会了怎么写高分作业的实习生。
