# Anthropic 搞了个内部跳蚤市场，让 AI 替员工砍价买卖

> 原标题：Anthropic created a test marketplace for agent-on-agent commerce

- 来源：TechCrunch · AI
- 发布时间：2026-04-25T21:43:37.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9910
- 原文：https://techcrunch.com/2026/04/25/anthropic-created-a-test-marketplace-for-agent-on-agent-commerce/

## 摘要

Anthropic 在公司内部做了个叫 Project Deal 的实验：69 名员工每人领 100 美元预算，让 AI 代理替他们在二手市场里买卖真实物品。最终成了 186 笔交易，总金额超过 4000 美元。实验同时跑了四个市场，分别用不同水平的模型。用更聪明模型代理的用户，成交结果确实更好，但用户自己没感觉出来——Anthropic 管这叫“代理...

## 推荐理由

HKR 三项都站得住：Anthropic 搞了个内部代理交易市场，有预算、有成交笔数、有成交额，还分了四个不同模型的市场来对比。分数维持 82 分，因为这只是内部测试，不是公开产品或模型发布，我会先打个折。实验发现高级模型带来更好结果但用户没察觉差距，这点先别太激动，正文没披露交易的具体品类和失败率，验证还弱。

## 锐评

Anthropic 这个内部实验挺有意思：他们搭了个二手市场，让 AI 代理替 69 名员工去讨价还价、完成真实交易，最终成交 186 笔，总金额超过 4000 美元。实验同时跑了四个市场，分别用不同水平的模型。结果发现，用更聪明模型的代理确实能拿到更好的成交结果，但用户本人完全没察觉到差距——Anthropic 管这叫“代理幻觉”。

这个发现很实在：模型能力提升带来的收益，在代理对代理的场景里是真实存在的，但用户感知不到。这意味着如果未来代理交易普及，模型厂商得想别的办法证明自己值那个价，不能光靠用户体感。

不过得打个折：实验只有 69 人参与，样本太小；而且是在公司内部、用真金白银但金额很小的二手市场跑的，放到真实电商环境里会怎样还不好说。正文没披露具体用了哪些模型、交易品类分布和失败率，这些缺口让结论的普适性打了折扣。
