Agent 学会自己从失败里长技能了:EvolveR 被 ICML 2026 接收
Agent学会自己「长」Skill了!从失败里长出经验,比人类写的更好用|ICML 2026
这篇讲的是让 AI 智能体在干活时,把成功和失败的经验都存下来,变成一个可复用的技能库。方法叫 EvolveR,核心是给经验打分、建库,再用 GRPO 训练智能体学会什么时候该去库里检索经验。论文在七个复杂问答基准上测了 Qwen2.5-3B 和 7B,说平均性能是目前最好的。不过正文因为微信环境验证没过去,具体实验数据、对比方法和消融实验都看不到,这...
推荐理由:标题的钩子很清晰——Agent 自己从失败轨迹里蒸馏经验,长出来的技能比人写的更强。正文给了 EvolveR 的方法名、7 个复杂问答基准和 Qwen2.5-3B/7B 的最优平均结果,信息量够。不过目前只有媒体摘要,没看到代码仓库、绝对分数和复现细节,所以分数先放在 82 这个研究发布档位。