# 编程助手的“外壳”可能让你多花一倍的钱，准确率却没变

> 原标题：HarnessTax: How Much Does the Harness Matter for Coding Agents?

- 来源：Hacker News 首页
- 发布时间：2026-09-16T22:10:13.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56964
- 原文：https://harnesstax.github.io/

## 摘要

UC Berkeley 和 Arena 的研究人员把 7 个模型装进 3 种不同的编程助手外壳（Claude Code、Codex CLI 和 Pi），在 SWE-bench Lite 和 Terminal-Bench 2.0 上各跑了 30 个任务，每个组合重复 3 次。结果发现，换外壳对任务成功率影响很小（±2–5%），但成本最多能差到 5 倍。比...

## 推荐理由

UC Berkeley和Arena的人做了件挺实在的事：把7个模型塞进3种不同的编程助手外壳里跑分，结果发现换壳对能不能完成任务影响很小，但花的钱最多能差5倍。这个结论对天天在终端里切工具的开发者来说很实用，而且实验设计干净、数字具体，没有吹牛成分。分数定在78，因为正文摘要没展开讲成本差异具体从哪来、不同外壳的失败模式有什么不同，信息有缺口，先不打更高。

## 锐评

这篇研究给了一个很实际的结论：模型本身才是决定编程任务成败的主角，外面那层助手软件（他们叫harness）更像是个成本开关。UC Berkeley和Arena的团队把7个模型塞进Claude Code、Codex CLI和Pi三种外壳里，在SWE-bench Lite和Terminal-Bench 2.0上各跑30个任务，每个组合重复3次。结果发现，换外壳对成功率的平均影响只有±2%到±5%，但花的钱能差出5倍。

最亮眼的是他们自己做的Pi，一个只保留读、写、编辑、执行命令的最简开源外壳。Claude Fable 5用Pi跑出96.7%的成功率，成本0.67美元；用Claude Code跑是97.8%，成本1.33美元。多花近一倍的钱，成功率只提了1.1个百分点。Pi在两张图上都摸到了性价比最优边界。

不过正文没披露Pi和Codex CLI的具体开源协议，也没给出完整的定价表链接。实验只跑了30个任务，样本量不大，结论能不能推广到更复杂的真实项目还不好说。另外，他们禁用了网络访问和网页工具，这在实际开发里不太现实，可能会压低某些外壳的优势。
