# ICML 2026 中稿的 FusionRoute：让多个模型在生成每个词时自己选最合适的专家，还能自我纠错

> 原标题：ICML 2026｜FusionRoute：从专家路由到自我修正，一种新的多LLM协作范式

- 来源：机器之心 · 公众号
- 发布时间：2026-06-07T03:30:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35117
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651037576&idx=3&sn=d9f62fcd25f17dc41ab5b387f1862731

## 摘要

这篇 ICML 2026 的论文提出了一种叫 FusionRoute 的多模型协作方法。它不直接合并模型，而是冻结住几个专家模型不动，只训练一个轻量的路由器。这个路由器会在生成文本的每一个 token（词或子词）时，实时挑选一个最合适的专家模型来输出，同时把路由器的判断分数和专家模型的输出分数揉在一起，让最终选择更准。论文在 GSM8K、MATH-50...

## 推荐理由

这篇 ICML 2026 的 FusionRoute 论文，核心是让几个冻住的专家模型在生成每个 token 时都能被一个轻量路由器实时挑选，还加了自我修正来纠错。思路确实有意思，但文章没给出具体的性能提升数字、代码链接和实际部署成本，所以我会先打个折，放在 featured 里偏低的档位。

## 锐评

FusionRoute 的思路很直接：把几个现成的专家模型冻住不动，只训练一个轻量路由器，让它决定生成每个 token 时该用哪个模型。路由器还会把自己的判断分数和专家模型的输出分数揉在一起，让选择更准。论文在 GSM8K、MATH-500、HumanEval 等几个常用基准上做了验证，看起来是想解决多模型协作时“谁该上场”的问题。

不过正文因为微信环境异常没拿到全文，具体性能数字、路由器参数量、推理延迟增加多少、对比了哪些基线方法，这些关键信息都看不到。从摘要看，方法本身不复杂，但 token 级别的实时切换对延迟的影响会是个实际落地的大问题。另外，如果专家模型本身能力差距不大，路由器的收益可能有限。

还缺的是：路由器的训练成本、不同专家组合的消融实验、以及在实际业务场景（比如客服、代码助手）里的表现。如果是真的能在不增加太多延迟的前提下稳定挑对专家，那对多模型部署确实省钱。
