# RTK 号称能省九成 token，我们实测账单反而涨了

> 原标题：RTK reports token savings, but our cost benchmarks disagree

- 来源：Hacker News 首页
- 发布时间：2026-09-11T11:15:13.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55907
- 原文：https://quesma.com/blog/does-rtk-make-ai-coding-cheaper/

## 摘要

Quesma 花了超过 1500 美元跑 Terminal-Bench 2.1，对比了 Claude Code 加 Fable 5.0 和 OpenCode 加 DeepSeek V4 Pro 0813 在开不开 RTK 时的真实花费。RTK 是一个给终端输出“瘦身”的工具，把 ls、git 等命令的返回结果压缩后再喂给模型，想靠减少上下文来省钱。结果...

## 推荐理由

Quesma 砸了 1500 美元跑 Terminal-Bench 2.1，对比 RTK 开不开时的实际花费，结果跟 RTK 自己说的 60% token 节省对不上。有真金白银的实测数据，有明确工具链，直接挑战热门省钱工具的宣传，对关心推理成本的 AI 从业者来说信息量够、冲突感强，值得推。

## 锐评

Quesma 花了超过 1500 美元跑 Terminal-Bench 2.1，对比了 Claude Code 和 OpenCode 在开不开 RTK 时的真实账单。结果很打脸：Claude 这边总花费只降了 5%，而且几乎全靠一个任务提前完成省下来的，其他任务基本没省。DeepSeek 那边更惨，平均每个任务的花费反而涨了 17%。

RTK 的原理是把 ls、git 这类命令的输出“瘦身”后再喂给模型，想靠减少上下文来省钱。但问题在于，模型读到的信息变少了，可能会多绕弯路、多跑几轮才能搞定，反而把省下的 token 又花出去了。RTK 自带的 `rtk gain` 指标也有水分，比如一个 `head -1` 调用被算成省了 1.2 亿 token，实际账单纹丝不动。

这篇文章只测了 Terminal-Bench 这一个基准，而且 DeepSeek 的通过率还掉了两个点。日常写代码的场景更杂，RTK 到底能不能省钱，还得看具体任务和模型。别光看压缩率就激动，先算算总账再说。
