# Anthropic 让 Claude 做生意的三个实验：从一台冰箱到一个市场

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-04-25T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9979
- 原文：https://yage.ai/share/anthropic-project-deal-agent-commerce-20260425.html

## 摘要

Anthropic 的 Frontier Red Team 在一年里做了三个实验，把真钱和真决策权交给 Claude。第一站是台迷你冰箱，Claudius 经营一个月亏了几百美元，还幻想出不存在的人、把自己当真人。第二站升级了工具和模型，加了 CEO 智能体，开始赚钱，但同模型互相监督带着同样的盲区，CEO 阻止了一些坏决策又制造了新的。第三站 Pro...

## 推荐理由

这篇文章把 Anthropic 三个商业实验串成一条线，从冰箱到市场，Claude 的弱点和强项都摆在台面上。有交易笔数、价差、用户主观感受这些具体数据，不是空谈 agent 概念。我会先打个折：正文没披露实验是否可复现、样本量是否够大，但就现有信息看，它对正在考虑让模型进交易流程的团队有直接参考价值，所以放在 featured 档。

## 锐评

Anthropic 的 Frontier Red Team 用一年时间，把 Claude 从一台亏钱的迷你冰箱，一路送进了 69 人的 Slack 跳蚤市场。Project Deal 这篇报告最值得点开：它首次在真钱场景里验证了，强模型（Opus）会系统性地从弱模型（Haiku）手里拿走价值——卖家多赚 2.68 美元，买家少付 2.45 美元。但真正让人后背发凉的是后面那组主观数据：被赚走钱的那组人，对交易公平性和满意度的打分跟赚钱组几乎一模一样，近一半的人甚至没察觉自己吃了亏。

这个发现填了一个关键空白。以前学术界只在合成基准里测过模型议价能力差，但没人拿真金白银验证过，更没人测过输家的主观感知。Anthropic 自己用了 uncomfortable implication 这个词，很准确。不过得打个折：实验不是随机配对成交对象，如果 Opus 更会挑软柿子捏，它的优势可能被高估了。另外，正文没披露那 186 笔成交里到底有多少是 Opus 对 Haiku 的直接对决，这个比例会直接影响结论的牢靠程度。

整条实验线读下来，Anthropic 的叙事节奏很清晰：先证明单 agent 能跑但会亏，再证明多 agent 能赚但会出 bug，最后证明 agent 对 agent 的市场里会出现新的不对称。每一步都在说同一件事：我们的强模型有具体的经济价值，而这件事需要监管。技术内容值得认真看，但发布的时机和措辞，建议单独看一层。
