# 多模型路由进了 Agent 会话，省钱的路子突然不灵了

> 原标题：多模型路由进入 Agent 会话之后

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-29T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47576
- 原文：https://yage.ai/share/agentic-multi-model-routing-20260729.html

## 摘要

多模型路由在单轮问答里能省钱省延迟，但一进多轮 Agent 会话就容易翻车。vLLM Semantic Router 的 issue #1439 记录了一个真实案例：用户在做 Go 重构，前几轮强模型跑得好好的，第四轮用户只说了句“looks good, commit it”，路由一看就四个词、难度低，直接切给一个 0.5B 小模型，结果小模型回了通客...

## 推荐理由

这篇文章不是官方发布，是个人博客，正文后半截被截断了，所以结论部分看不到完整推演。但前半段给的 vLLM issue #1439 案例足够扎实：一个 0.5B 小模型因为路由只看当前轮次词数，在多轮 Agent 会话里接不住上下文，直接暴露了“按单轮难度打分”进多轮场景的脆弱性。对正在做推理管线、模型调度的人，这个坑值得提前知道。我会先打个折，因为文章没给修复方案或后续讨论，信息停在问题陈述上。

## 锐评

这篇文章把多模型路由在 Agent 场景下的尴尬讲得很透。核心矛盾在于，单轮问答里靠语义难度切模型能省钱，但多轮会话里，一句“looks good, commit it”被切给 0.5B 小模型后直接掉链子——路由器只看四个词，不知道前面几轮强模型已经搭好了代码重构的上下文。

文章梳理了四个工程硬伤：历史格式不兼容、Prompt Cache 失效、隐式思维链无法迁移、多模态产物缝合成本高。这些不是算法问题，是物理限制。目前业界的应对分三路：Cursor 和 Claude Code 用子任务隔离上下文；vLLM 的 SAAR 让路由器记住会话状态并在工具调用期间锁模型；大多数生产环境干脆固定用一个强模型，省心。

信息源主要来自 vLLM Semantic Router 的 issue 和官方博客，案例具体，但缺少第三方生产环境的对比数据。文章没披露固定强模型方案在实际业务中的成本占比，也没给出子任务方案在复杂工作流里的失败率。这些缺口让“最佳固定模型”基线听起来合理，但缺乏量化支撑。
