# 通义开源 Qwen-AgentWorld：一个会先预测再动手的智能体模型

> 原标题：Qwen-AgentWorld 开源：让 Agent 学会"先预测，再行动"

- 来源：AI HOT 精选
- 发布时间：2026-06-24T03:32:04.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/40163
- 原文：https://mp.weixin.qq.com/s/NV9WGpGsfFz35jww5agM9g

## 摘要

通义千问放出了一个叫 Qwen-AgentWorld 的模型，它不是一个只会接指令的工具，而是先对世界状态做预测再执行动作。模型覆盖了 MCP、搜索、命令行、软件工程、网页、操作系统和安卓七个场景，训练用了超过一千万条真实交互记录，分三步走：先海量预训练，再监督微调，最后强化学习对齐。在自家评测 AgentWorldBench 上，397B 总参、17...

## 推荐理由

通义千问放出的 Qwen-AgentWorld 不是又一篇 agent 概念文，而是把“先预测世界状态再执行动作”这个思路做进了模型训练里，覆盖七个场景、千万级真实交互数据，三步训练路线也公开了。397B 总参数量不小，但 17B 激活参数意味着推理成本可控，这点对实际用的人来说挺关键。自家评测跑分好看，但刚开源，社区还没大规模验证，所以分数先打 82，等有人复现了再往上调。

## 锐评

这条消息的核心是：通义千问开源了一个叫Qwen-AgentWorld的模型，它想让AI Agent干活前先对当前状态做个预测，再决定怎么动，而不是闷头执行指令。模型覆盖了MCP、搜索、命令行、软件工程、网页、操作系统和安卓七个场景，训练用了超过一千万条真实交互记录，分三步走：先海量预训练，再监督微调，最后强化学习对齐。

在自家评测AgentWorldBench上，397B总参的版本拿了58.71分，比GPT-5.4的58.25和Claude Opus 4.8高一点点。这点差距先别太激动，毕竟评测集也是自己出的，外部公平性还没验证。比较有意思的是它当环境模拟器用的时候，在WideSearch任务上通过模拟强化学习拿到了50.3%的F1，比直接在真实环境里训的45.6%要好，说明这种“先猜再动”的思路在模拟训练里确实能省成本。

正文没披露训练用了多少算力、推理延迟怎么样，也没说这七个场景之外泛化能力如何。模型和评测都开源了，但实际能不能在你的业务场景里跑起来，还得自己试。
