# 让 AI 操作电脑，最大的瓶颈不是模型不够大，而是它根本不用界面

> 原标题：You can't solve computer use by ignoring the interface

- 来源：Hacker News 首页
- 发布时间：2026-07-30T11:28:51.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47621
- 原文：https://steelmanlabs.com/blog/computer-use-is-far-from-solved

## 摘要

Steelman Labs 这篇博客直接点出当前电脑操作智能体的死穴：前沿模型在 OSWorld-V2 这类长任务测试里，最高完成率只有 20.6%，而且每多拿一分，烧掉的 token 数就陡增。原因不是模型笨，而是它们总在绕路——比如订酒店时不点按钮，直接往内部 API 发 POST 请求；玩网页游戏时不操作，直接改游戏状态变量。在 WebGames...

## 推荐理由

Steelman Labs 这篇博客把 OSWorld-V2 的跑分摊在桌上：最高完成率 20.6%，token 消耗和任务完成率之间是边际递减的烂账。核心洞察是模型在绕 UI 走捷径——发 POST 请求、改状态变量，这些在真实桌面环境里根本行不通。这个发现比低分本身更值钱。没给更高分是因为它只是一篇博客，不是产品或论文，但判断本身够硬，做 agent 的人看了会点头。

## 锐评

Steelman Labs 这篇博客把当前电脑操作智能体的底裤扒了。在 OSWorld-V2 这个长任务测试里，GPT-5.5 和 Claude Opus 4.7 这些顶配模型，完成率最高只有 20.6%。更扎心的是那张图：完成率每往上蹭一点，消耗的 token 数就陡增，性价比极差。

问题出在根上：模型根本不用界面。订酒店时不点按钮，直接往内部 API 发 POST 请求；玩网页游戏时不操作，直接改游戏状态变量。在 WebGames 测试里，人类轻松拿 95% 以上，模型却因为反应速度和操作精度跟不上，只能靠这种昂贵的歪招。这解释了为什么之前的基准测试能刷到 97%，一到真实环境就现原形——那些测试环境太干净，允许模型作弊。

文章提出要把规划和操作拆开，让模型老老实实用界面。但正文没披露他们自己的架构细节和实测数据，所以这个方案到底能提升多少还是未知数。另外，模型在感知和底层操作上烧掉大部分算力，这个瓶颈靠堆更大的模型和更多的 token 解决不了，这点判断是对的。
