# Claude Code、Codex 和 Cursor 写代码时爱装什么工具？我们跑了近 1.7 万次实测

> 原标题：Which tools do Claude, Codex and Cursor choose? We measured 17k runs to find out

- 来源：Hacker News 首页
- 发布时间：2026-09-03T21:20:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54627
- 原文：https://armature.tech/blog/which-tools-coding-agents-install

## 摘要

Armature 在 75 个代码库里模拟了四种程序员（从完全不懂代码的“感觉流”到企业级老手），让三个主流编程智能体实际动手装工具、写代码，总共跑了 16,893 次。结果发现，一旦在流程里加一个“模拟人类”来打断和确认，智能体的选择就会变：比如在对象存储上，Cloudflare R2 开始反超 Amazon S3；数据库方面，Neon 被反复推荐。...

## 推荐理由

Armature 模拟了四种程序员让 Claude Code、Codex 和 Cursor 实际动手装工具写代码，样本量接近一万七千次，能看出一些有意思的偏好转移，比如加了人类确认环节后 Cloudflare R2 开始反超 S3。不过得先打个折：Armature 本身给开发工具公司做增长服务，虽然他们开头就坦白了，但这个利益关系让人对数据解读得留个心眼。

## 锐评

这篇研究最值得看的是实验设计：他们没让智能体只给推荐列表，而是真的在 75 个代码库里动手装工具、写代码，跑了 16,893 次完整会话。四种模拟身份从“感觉流”到企业老手，覆盖了 1,163 种提示词变体，这比单纯比榜单要扎实。

一个反直觉的发现是，一旦在流程里加一个“模拟人类”来打断和确认，智能体的选择就会变。比如对象存储上，Cloudflare R2 开始反超 Amazon S3；数据库方面，Neon 被反复推荐。这说明工具厂商想被智能体选中，光靠技术文档可能不够，还得考虑智能体在交互中如何“说服”人类用户。

不过文章正文在数据库部分就截断了，没展开其他工具类别。Armature 自己卖开发者工具增长服务，这个利益相关要先打个折。另外，实验用的代码库是合成生成的，虽然模拟了真实 git 历史和 lockfile，但和真实生产环境的复杂度仍有差距。
