# 同一个模型套 9 种外壳，跑通一次的成本差了 17 倍

> 原标题：Show HN: FrontierHarness Eval – 9 harness, same model, cost per pass varies 17x

- 来源：Hacker News 首页
- 发布时间：2026-09-02T16:14:52.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54341
- 原文：https://frontierharness.org

## 摘要

Runta 用 Kimi K3 模型跑了 12 套不同的编程助手配置，总共 360 次测试，每次都是从完全相同的初始环境冷启动。Codex 通过率最高，66.7%，每次任务成本 3.47 美元；Exo Harness 最省钱，每次只要 1.05 美元，但通过率掉到 53.3%；Claude Code 通过率 63.3%，但每次任务要花 18.34 美元...

## 推荐理由

这篇评测干净利落，控制变量做得很好：同一个 Kimi K3 模型，12 套配置，全部从零冷启动，总共 360 次测试。结论很直观——最贵的 Claude Code（18.34 美元/次，通过率 63.3%）被最省的 Codex（3.47 美元/次，通过率 66.7%）反超，成本差了 17 倍。没给更高分是因为这只是一篇博客，不是长期追踪的榜单，样本量也有限。但就单次实验来说，信息量够硬，对选工具的人很有参考价值。

## 锐评

Runta 用 Kimi K3 这个模型，给12套编程助手配置做了个公平对比。每次测试都从完全一样的初始环境冷启动，跑了360次，避免了缓存带来的水分。结果很直观：Codex 通过率最高，66.7%，每次任务成本3.47美元。但最省钱的是 Exo Harness，每次只要1.05美元，通过率53.3%，比 Codex 便宜了七成。最离谱的是 Claude Code，通过率63.3%看着还行，但每次任务要烧掉18.34美元，是 Exo Harness 的17倍多。

这里有个反直觉的点：缓存命中率高不代表省钱。Claude Code 的缓存命中率最低，只有67.8%，但每次成功任务的成本高达0.288美元，是所有配置里最贵的。OpenCode 虽然总成本低，但那是只算成功次数的障眼法，算上失败的任务，实际成本就跳到3.24美元了。

正文没披露具体用了哪些软件工程任务，也没说难度分布。所以这些数字只能说明在这个特定测试集下的表现，换一批任务排名可能就变了。另外，所有测试都在 Runta 自己的平台上跑，虽然声称中立，但自家产品有没有隐性优化不好说。
