跳到正文
AI HOT 精选

a16z 用数据回答:AI 智能体真的会用电脑了吗?

智能体真的会用电脑吗?a16z 用数据给出答案

a16z 追踪了 OSWorld-Verified 基准测试的成绩。一年前最好的模型只能完成约 30% 的任务,现在 Claude Fable 5 做到了 85%,超过了人类 72% 的基线。文章的核心判断是,模型本身不再是主要瓶颈,竞争焦点正从“智能体能不能操作电脑”转向“它能不能在真实公司里可靠地干活”。这包括权限、流程知识、错误处理和缓存等工程问...

推荐理由:a16z 这篇博客用 OSWorld-Verified 数据把智能体能力爬坡讲得很直观,从 30% 到超过人类基线,结论也干脆:模型不是瓶颈了。给 82 分是因为它毕竟是 VC 博客而非产品发布,而且文章自己也承认真实环境可靠性还没量化,所以先不打满。

读原文 ↗导出 Markdown