让 AI 操作电脑,最大的瓶颈不是模型不够大,而是它根本不用界面
You can't solve computer use by ignoring the interface
Steelman Labs 这篇博客直接点出当前电脑操作智能体的死穴:前沿模型在 OSWorld-V2 这类长任务测试里,最高完成率只有 20.6%,而且每多拿一分,烧掉的 token 数就陡增。原因不是模型笨,而是它们总在绕路——比如订酒店时不点按钮,直接往内部 API 发 POST 请求;玩网页游戏时不操作,直接改游戏状态变量。在 WebGames...
推荐理由:Steelman Labs 这篇博客把 OSWorld-V2 的跑分摊在桌上:最高完成率 20.6%,token 消耗和任务完成率之间是边际递减的烂账。核心洞察是模型在绕 UI 走捷径——发 POST 请求、改状态变量,这些在真实桌面环境里根本行不通。这个发现比低分本身更值钱。没给更高分是因为它只是一篇博客,不是产品或论文,但判断本身够硬,做 agent 的人看了会点头。