# a16z 用数据回答：AI 智能体真的会用电脑了吗？

> 原标题：智能体真的会用电脑吗？a16z 用数据给出答案

- 来源：AI HOT 精选
- 发布时间：2026-08-10T14:00:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49841
- 原文：https://www.a16z.news/p/can-agents-use-a-computer-yet-weve

## 摘要

a16z 追踪了 OSWorld-Verified 基准测试的成绩。一年前最好的模型只能完成约 30% 的任务，现在 Claude Fable 5 做到了 85%，超过了人类 72% 的基线。文章的核心判断是，模型本身不再是主要瓶颈，竞争焦点正从“智能体能不能操作电脑”转向“它能不能在真实公司里可靠地干活”。这包括权限、流程知识、错误处理和缓存等工程问...

## 推荐理由

a16z 这篇博客用 OSWorld-Verified 数据把智能体能力爬坡讲得很直观，从 30% 到超过人类基线，结论也干脆：模型不是瓶颈了。给 82 分是因为它毕竟是 VC 博客而非产品发布，而且文章自己也承认真实环境可靠性还没量化，所以先不打满。

## 锐评

a16z 这篇博客给了一个很直观的进度条：一年前最好的模型在 OSWorld-Verified 这个“让 AI 操作真实电脑界面”的测试里只能完成大约 30% 的任务，现在 Claude Fable 5 做到了 85%，已经比人类 72% 的基线高出一截。这个数字说明，单看模型能力，让它点按钮、填表单、在老旧系统里搬运数据，已经不是最大的卡点了。

但文章自己也打了预防针。现在的智能体只能在高度标准化的后台流程里跑得稳，比如更新记录、处理工单。一旦任务偏离操作手册，或者遇到没法做缓存的场景，成本就会高到不划算。正文没给出具体的单次任务成本数字，只说“数学上不是处处都成立”，这点先别太激动。

真正的战场已经从“能不能操作电脑”转移到了“能不能在真实公司里可靠地干活”。这背后缺的不是更强的模型，而是权限怎么给、流程知识怎么喂、出错后怎么自己修、以及怎么把成本压到比人力外包更低。文章没展开讲这些工程细节，但点出了方向：谁先搞定这些脏活累活，谁才能把 85% 的测试分数变成能收钱的生意。
