# Qwen 发布 WebWorld 系列模型，用 100 多万条真实网页操作轨迹训练，让模型学会在浏览器里干活

> 原标题：Qwen/WebWorld 32B/14B/8B (Qwen3 finetune)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-07T14:28:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15584
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t6c6vs/qwenwebworld_32b14b8b_qwen3_finetune/

## 摘要

Qwen 在 Qwen3 基础上微调出了 WebWorld 32B、14B、8B 三个尺寸的模型，专门用来训练和评测能在网页上执行任务的智能体。训练数据包含超过 100 万条真实网页操作轨迹，模拟环境支持 30 步以上的连续操作，并且能同时看懂无障碍树、HTML、XML、Markdown 和自然语言描述这五种页面状态。用这套数据生成的合成轨迹再去训智能...

## 推荐理由

我会先打个折：正文没披露合成轨迹的具体生成方式，也没说这 100 万条数据覆盖了哪些网站类型，所以别急着当通用方案。但亮点很实在——用合成轨迹训练小模型做网页操作，在 MiniWob++ 和 WebArena 上都拿到了 10% 左右的提升，说明这条路走得通。对正在折腾 Web agent 的人来说，数据和评测结果比模型本身更有用。

## 锐评

Qwen 在 Qwen3 基础上微调出了 WebWorld 系列，有 32B、14B、8B 三个尺寸，专门训练模型在网页上执行任务。训练数据用了超过 100 万条真实网页操作轨迹，模拟环境支持 30 步以上的连续操作，还能同时看懂无障碍树、HTML、XML、Markdown 和自然语言描述这五种页面状态。用这套数据生成的合成轨迹再去训智能体，在 MiniWob++ 上提了 9.9%，WebArena 上提了 10.9%。

不过这条信息来自 Reddit，原文被网络屏蔽，正文没披露训练成本、推理延迟、不同尺寸模型的具体表现差异，也没说这 100 万条轨迹覆盖了多少网站类型。9.9% 和 10.9% 的提升看着不错，但不知道对比的基线是什么模型、什么配置，这点先别太激动。另外，能同时处理五种页面状态听起来很全，但实际推理时会不会因为输入太长导致速度变慢，正文也没提。
