多模型路由进了 Agent 会话,省钱的路子突然不灵了
多模型路由进入 Agent 会话之后
多模型路由在单轮问答里能省钱省延迟,但一进多轮 Agent 会话就容易翻车。vLLM Semantic Router 的 issue #1439 记录了一个真实案例:用户在做 Go 重构,前几轮强模型跑得好好的,第四轮用户只说了句“looks good, commit it”,路由一看就四个词、难度低,直接切给一个 0.5B 小模型,结果小模型回了通客...
推荐理由:这篇文章不是官方发布,是个人博客,正文后半截被截断了,所以结论部分看不到完整推演。但前半段给的 vLLM issue #1439 案例足够扎实:一个 0.5B 小模型因为路由只看当前轮次词数,在多轮 Agent 会话里接不住上下文,直接暴露了“按单轮难度打分”进多轮场景的脆弱性。对正在做推理管线、模型调度的人,这个坑值得提前知道。我会先打个折,因为文章没给修复方案或后续讨论,信息停在问题陈述上。