# Qwen 发布 AgentWorld：一个能模拟环境、帮 AI 智能体练级的语言世界模型

> 原标题：Qwen-AgentWorld: Language World Models for General Agents

- 来源：Hacker News 首页
- 发布时间：2026-06-24T02:21:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40167
- 原文：https://arxiv.org/abs/2606.24597

## 摘要

Qwen 团队搞了个新东西，叫 Qwen-AgentWorld，本质上是一个用语言模型做的世界模拟器。它不直接干活，而是预测“在当前环境下做了某个动作后，下一步会发生什么”，覆盖了 7 种不同的场景。为了让模型学会这个本事，他们用了超过 1000 万条真实环境里的交互记录，分三步训练：先灌知识让它理解状态变化，再教它一步步推理出下一步，最后用规则和评分...

## 推荐理由

Qwen 团队拿语言模型当世界模拟器用，在 7 种环境里用超千万条交互记录训练它预测“做了某动作后会发生什么”。思路新，数据量和训练步骤也实在，对搭 agent 的人有参考价值。不过目前还是论文，不是产品，实际任务里能省多少事、准不准，还得看后续验证，所以分数没给太高。

## 锐评

Qwen 团队这次没做直接干活的智能体，而是做了一个“世界模拟器”——Qwen-AgentWorld。你可以把它理解成一个预测引擎：给定当前状态和动作，它用长链推理去猜下一步环境会变成什么样。这相当于给智能体配了个可以脑补后果的沙盘。

训练数据量不小，用了超过 1000 万条真实环境里的交互记录，分三步训练：先灌知识理解状态变化，再教模型一步步推理，最后用规则加评分来校准模拟的逼真度。模型分两个尺寸，小的 35B-A3B，大的 397B-A17B。团队还专门搭了个评测集 AgentWorldBench，用 5 个前沿模型的真实交互记录来考它，说 Qwen-AgentWorld 明显超过现有模型。

这篇论文的亮点在于两种用法：一是把模拟器拆出来单独用，能同时跑几千个环境帮智能体做强化学习，效果比只在真实环境里练要好；二是把世界模型训练当成智能体的热身步骤，能让它在 7 个下游任务上表现更好。不过，正文没给出模拟准确率的具体数字，只说“显著优于”，这点先别太激动。另外，1000 万条数据听起来多，但覆盖 7 个领域后每个领域能分到多少、质量如何，论文摘要里也没细说。代码开源了，具体效果得跑起来才知道。
