# UCL 等团队开源 Avenir-Web，一个不用额外训练就让网页智能体干活更稳的框架，在 ONLINE-MIND2WEB 上跑到 53.7%

> 原标题：龙虾冲浪终于不迷路了！网页智能体新框架Avenir-Web开源即SOTA

- 来源：量子位 · 公众号
- 发布时间：2026-04-29T12:44:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12469
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247887827&idx=3&sn=6f15e73e3e9766986b064a1fce6fe955

## 摘要

Avenir-Web 是 UCL、普林斯顿和爱丁堡大学一起开源的一个网页智能体框架，主打不训练、直接给模型套上就能用。它在 ONLINE-MIND2WEB 这个包含 136 个网站、300 个真实在线任务的测试里，成功率做到了 53.7%。对比一下，用 Gemini 3 Pro 跑的时候，它比 Claude Computer Use 3.7 的 47....

## 推荐理由

HKR 三项都站得住：标题有记忆点，数字和对比够具体，选题踩中网页智能体可靠性和模型选型这两个从业者高频焦虑点。这是开源研究发布，不是大厂模型首发，82 分放在 78–84 区间合理。

## 锐评

Avenir-Web 这个框架最大的卖点是“零训练”，直接给模型套上就能干活。它在 ONLINE-MIND2WEB 测试里拿了 53.7% 的成功率，用 Gemini 3 Pro 跑的时候比 Claude Computer Use 3.7 的 47.3% 高出六个多点。测试覆盖了 136 个网站、300 个真实在线任务，样本量不算小，但任务类型和难度分布正文没细说，所以这个领先幅度到底值不值得激动，得打个折。

框架本身靠几个模块堆效果：EIP 负责理解页面元素，MoGE 做多模态信息融合，外加检查清单和自适应记忆。听起来完整，但实际落地时这些模块会不会互相拖慢响应速度，正文没提延迟数据。另外，53.7% 意味着还有近一半任务会翻车，在需要高可靠性的生产环境里，这个数字还撑不住。

还缺什么：没看到在不同模型上的横向对比，不知道换成 GPT-4o 或开源模型还能不能保持优势；也没披露任务失败的主要原因，是页面解析出错还是动作决策失误，这对想用的人很重要。
