# Agent 学会自己从失败里长技能了：EvolveR 被 ICML 2026 接收

> 原标题：Agent学会自己「长」Skill了！从失败里长出经验，比人类写的更好用｜ICML 2026

- 来源：量子位 · 公众号
- 发布时间：2026-05-18T09:23:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/22627
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247891568&idx=3&sn=798782569e8d7450ac5d2adf5e592159

## 摘要

这篇讲的是让 AI 智能体在干活时，把成功和失败的经验都存下来，变成一个可复用的技能库。方法叫 EvolveR，核心是给经验打分、建库，再用 GRPO 训练智能体学会什么时候该去库里检索经验。论文在七个复杂问答基准上测了 Qwen2.5-3B 和 7B，说平均性能是目前最好的。不过正文因为微信环境验证没过去，具体实验数据、对比方法和消融实验都看不到，这...

## 推荐理由

标题的钩子很清晰——Agent 自己从失败轨迹里蒸馏经验，长出来的技能比人写的更强。正文给了 EvolveR 的方法名、7 个复杂问答基准和 Qwen2.5-3B/7B 的最优平均结果，信息量够。不过目前只有媒体摘要，没看到代码仓库、绝对分数和复现细节，所以分数先放在 82 这个研究发布档位。

## 锐评

这篇讲的方法叫 EvolveR，核心是让 AI 智能体在干活时把成功和失败的经验都存下来，变成一个可复用的技能库。它会给每条经验打分，再用 GRPO 训练智能体学会什么时候该去库里检索经验。论文在七个复杂问答基准上测了 Qwen2.5-3B 和 7B，说平均性能是目前最好的。

但问题在于，正文因为微信环境验证没过去，具体实验数据、对比方法和消融实验都看不到。这就像有人告诉你他考了全班第一，但成绩单被锁在抽屉里。没有这些信息，很难判断这个“最好”到底领先多少，是在什么条件下测出来的，换个大模型或者换个任务还能不能保持。

另外，经验库的维护成本、检索延迟这些工程上的坑，正文没披露。如果库大了检索变慢，或者存了一堆没用的经验反而拖后腿，那实用性就要重新评估。这点先别太激动，等看到完整论文再说。
