# Agent-World 用近两千个环境训练通用智能体，任务平均超过 15 步

> 原标题：Agent-World：扩展真实世界环境，让智能体与环境协同进化！

- 来源：机器之心 · 公众号
- 发布时间：2026-05-05T03:59:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14918
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651031346&idx=3&sn=40ac6c7a7ac8a91fdcee5da9a07f31af

## 摘要

这篇文章的正文被微信环境验证挡住了，看不到具体内容。从已有的英文摘要看，Agent-World 这个工作造了 1978 个环境和 19822 个工具，专门用来训练能处理长流程任务的智能体。它的做法是把网页挖掘、工具生成、可验证的任务合成和 GRPO 训练串在一起，任务平均要跑 15 步以上。核心结论是环境数量、自我进化轮次和 23 个基准测试之间存在规...

## 推荐理由

我会先打个折：正文没披露训练成本和实际延迟，也没说这 1,978 个环境里有多少是真正开放域、多少是模板生成的，这点先别太激动。但 Agent-World 把环境规模、自进化轮次和基准表现拉通看缩放关系，这个思路比单纯刷榜有用。对做智能体评估和长程任务的人，值得花时间读一下它怎么用 GRPO 把环境生成和智能体训练拧成一个闭环。

## 锐评

这篇论文想解决一个实际问题：让 AI 智能体学会处理需要十几步才能完成的复杂任务，比如订机票、查资料再汇总。他们没靠人工一个个写环境，而是用网页挖掘和工具生成自动造了 1978 个环境和近两万个工具，任务平均要跑 15 步以上。训练上用了 GRPO，一种让模型通过偏好对比自我进化的方法。核心发现是环境数量、自我进化轮次和 23 个基准测试的成绩之间存在正相关，说明规模确实有用。

但这里得打个折。正文被微信的验证页面挡住了，具体实验设置、模型规模、任务成功率这些数字全看不到。摘要里提的“23 个基准测试”也没说清楚是哪些，是自家造的还是在公开榜单上比的。另外，自动生成的环境质量怎么样、有没有奇怪的捷径让模型钻空子，这些都没法判断。如果后续能看到完整论文，重点要盯一下他们怎么保证任务可验证，以及这套方法换到真实业务场景里还灵不灵。
