# 浏览器智能体的苦涩教训：模型越强，脚手架就该拆得越干净

> 原标题：The bitter lesson of browser agents

- 来源：Hacker News 首页
- 发布时间：2026-09-15T15:03:38.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56723
- 原文：https://browser-use.com/posts/bitter-lesson-browser-agents

## 摘要

Browser Use 的 CTO 复盘了他们两年里三次推倒重来的架构选择。一开始他们给 GPT-4o 喂预定义的页面状态和固定动作菜单，模型只能从点击、输入、滚动里选。2025 年 9 月他们改成让模型直接写 JavaScript 来操作页面，token 消耗直接砍掉 60% 以上。但很快发现下一个瓶颈是观察层——他们提取的页面信息会漏掉 cooki...

## 推荐理由

Browser Use 的 CTO 亲自下场写复盘，三次架构重写加上 60% 的 token 节省，干货是有的。但本质是工程经验分享，不是重大突破或行业事件，所以分数到不了 85 以上那档。

## 锐评

Browser Use 的 CTO 复盘了他们从 2024 年底到现在的三次架构大改，过程很诚实。一开始他们给 GPT-4o 喂固定的页面状态和动作菜单，模型只能从点击、输入、滚动里选。2025 年 9 月改成让模型直接写 JavaScript 操作页面，token 消耗直接砍了 60% 以上，这点如果是真的挺省钱。但很快发现新瓶颈：他们提取的页面信息会漏掉 cookie 弹窗、shadow-DOM 下拉菜单这些藏在暗处的东西。现在他们把原始 CDP 权限直接交给模型，让模型自己看页面、自己写执行代码，只留一层很薄的调度壳。

这个演进方向本身不意外，但文章没给当前架构的跑分数据，也没说换成 CDP 后任务成功率到底提升了多少。另外，让模型直接写操作代码，安全边界和错误恢复怎么处理，正文也没展开。这些缺口让判断得打个折——思路对，但落地效果还得看后续公开的基准测试。
