# 模型路由很简单，直到你开始算真实成本

> 原标题：Model Routing Is Simple. Until It Isn’t.

- 来源：Hugging Face 博客
- 发布时间：2026-07-15T17:27:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45365
- 原文：https://huggingface.co/blog/ibm-research/model-routing-is-simple-until-it-isnt

## 摘要

IBM 的人拿 417 个 AppWorld 任务跑了一遍，发现按标价选模型会翻车。Claude Sonnet 4.6 总花费 79 美元，GPT-4.1 却花了 155 美元，贵了快一倍。原因是 agent 干活时会反复用同一大段上下文，Sonnet 的缓存读取价更低，靠这个把总账拉回来了。文章的意思很直接：路由不是分类问题，是系统优化问题，光看标价...

## 推荐理由

IBM 的人拿 417 个 AppWorld 任务实测，发现按标价选模型会翻车。Claude Sonnet 4.6 总花费 79 美元，GPT-4.1 花了 155 美元，贵了快一倍。原因是 agent 干活时会反复用同一大段上下文，Sonnet 的缓存读取价更低，靠这个把总账拉回来了。文章的核心判断很直接：模型路由不是分类问题，是系统优化问题，光看标价会吃大亏。这个结论有具体数字支撑，对正在搭 agent 的团队有直接参考价值，我会先打个折——正文没披露任务的具体难度分布和失败率，但 417 个任务的样本量已经够说明趋势了。

## 锐评

IBM 的人拿 417 个 AppWorld 任务跑了一遍，结论很直接：给 agent 选模型不能只看单次调用价格，那会翻车。他们对比了 Claude Sonnet 4.6 和 GPT-4.1，Sonnet 标价不便宜，但总花费 79 美元，GPT-4.1 却花了 155 美元，贵了快一倍。原因是 agent 干活时会反复用同一大段上下文，Sonnet 的缓存读取价更低，靠这个把总账拉回来了。

文章把路由问题拆成成本、复杂度和延迟三个坑，每个坑都指向同一个事实：真实开销是工作负载和基础设施互相作用的结果，不是给任务贴个标签再分给对应模型那么简单。正文没披露延迟的具体数据和复杂度衡量的量化标准，这部分只能看个方向。

对正在搭 agent 系统的团队来说，这条值得点开看：它提醒你在做路由决策前，先搞清楚自己工作负载的上下文复用率、缓存命中率和各家的阶梯定价，不然算出来的成本可能差一倍。
