# 做 AI 智能体，先设计路由再选模型

> 原标题：构建AI智能体应优先设计路由

- 来源：AI HOT 精选
- 发布时间：2026-07-01T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41789
- 原文：https://www.tomtunguz.com/ai-execution-routing

## 摘要

Tomasz Tunguz 认为，团队应该先搭路由层，最后再挑模型。路由是一小段代码，负责判断每个请求该交给哪一档模型处理。做对了，70% 到 80% 的流量可以跑在几乎免费的本地模型或异步模型上，AI 开销能砍掉九成以上。他举了 Coinbase 的例子：Token 用量在涨，但 AI 成本反而砍半，靠的就是更好的默认设置、路由和缓存。路由栈分三层：...

## 推荐理由

Tunguz 把“模型优先”的惯性翻了过来，主张先搭路由层，用一小段代码决定每个请求交给哪档模型。这个判断有 Coinbase 的真实数据撑着：Token 用量在涨，AI 成本反而砍半，靠的就是更好的默认设置、路由和缓存。文章给出的 70%–80% 流量可走免费模型、成本砍九成这些数字，让论点不是飘在空中的架构建议，而是可以直接拿来算账的参考。我会先打个折——正文没披露 Coinbase 路由的具体实现细节和失败率，所以“砍九成”更像一个理想上限，实际落地要看团队对延迟和错误率的容忍度。但整体上，这篇文章对正在纠结模型账单的从业者来说，提供了一个先...

## 锐评

Tomasz Tunguz 这篇文章的核心判断很直接：做 AI 智能体，别一上来就纠结用哪个大模型，先把“路由”这层小代码写好。路由说白了就是个调度员，它不看用户具体说了什么，而是根据任务类型、复杂度和历史成功率，决定把活派给哪一档模型去干。他给出的数据是，路由做对了，70% 到 80% 的流量可以跑在几乎免费的本地模型或者异步模型上，AI 整体开销能砍掉九成以上。Coinbase 的 Brian Armstrong 也印证了这点，他们的 Token 用量在涨，但靠更好的默认设置、路由和缓存，成本反而减半。

文章把路由栈拆成了三层：技能分类器负责识别“要干什么”，路由器负责决定“谁来干”，模型选择器则在同档模型里挑最便宜的。这个拆法很实用，把语言理解问题和调度问题分开了，方便后续对不同模型做 A/B 测试。他们自己还在路由器上加了两层反馈：一个是同步的故障信号预测，提前标记那些缺上下文、依赖链长的高风险任务；另一个是每晚跑一遍昨天的记录，自动更新路由权重，而且这套评估跑在异步推理上，成本接近零。

不过，文章主要讲了怎么省钱，对延迟和可靠性的讨论偏少。把任务丢进队列异步处理，确实能省大钱，但像“起草回复”这种活，用户能接受等多久，正文没给具体数字。另外，那 70% 到 80% 的流量能切给本地模型，前提是“技能蒸馏”做得足够好，能把复杂操作压平，但具体怎么蒸馏、失败率是多少，文章也没展开。这点先别太激动，得看自己业务的容错率。
