# Anthropic 的 Computer Use 是怎么训练出来的——从一项专利读它的数据管线

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-05-10T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17121
- 原文：https://yage.ai/share/anthropic-computer-use-training-patent-20260510.html

## 摘要

Anthropic 一项专利披露了 Computer Use 的训练数据管线，核心不是录屏，而是把原始操作变成带推理链的数据。管线分三步：截获用户操作时允许附加思考标注，用多模态模型把点击坐标翻译成语义意图，再用更强的模型做合成扩展，一条真实轨迹变出几十条带推理变体的样本。学术数据集能训出跑 benchmark 的原型，但覆盖软件少、轨迹偏干净、缺少长...

## 推荐理由

这篇不是官方发布，是从专利里扒出来的分析，所以我会先打个折。但它把 Computer Use 的数据管线讲得很实在：先截屏记录人的操作，再用 transformer 推断操作背后的意图，最后让强模型把意图扩展成更多样的训练样本。对正在搭 agent 的团队来说，这套思路能直接参考，尤其是怎么把少量人工操作放大成训练数据。正文没披露具体模型规模和成功率数字，这点先别太激动。

## 锐评

这条专利讲清了 Anthropic 的 Computer Use 数据从哪来，以及为什么学术数据集训不出产品。关键差别在于，他们的管线把原始操作变成了带推理链的数据：先截获用户操作并允许附加思考标注，再用多模态模型把点击坐标翻译成语义意图，最后用更强的模型做合成扩展，一条真实轨迹变出几十条带推理变体的样本。

这解释了为什么 Claude 操作软件时显得更“懂”界面，而不是机械地重复坐标。但专利正文没披露这套管线实际产出了多大规模的数据，也没说合成样本的准确率如何验证。如果合成扩展引入了错误推理，模型反而会学到坏习惯。另外，管线依赖用户主动标注思考过程，这在实际采集中的覆盖率有多高，正文也没提。

对从业者来说，这条管线的价值在于它把数据采集从“录操作”变成了“采推理”。但别急着激动——专利保护的是流程组合，不是模型能力。能不能持续低成本地跑通这条管线，才是真正的护城河。
