# vLLM 搞了个 Micro-Agent：让多个模型在 API 内部组队干活，效果能超过单个顶尖模型

> 原标题：Micro-Agent: Beat Frontier Models with Collaboration Inside Model API

- 来源：Hacker News 首页
- 发布时间：2026-06-29T18:03:26.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41300
- 原文：https://vllm.ai/blog/2026-06-29-micro-agent-frontier-models

## 摘要

vLLM 的语义路由器现在不只是把请求分给最合适的模型，它还能让多个模型在背后协作，但对外只暴露一个模型名。用户照常调用 API，路由器会根据任务难度和预算，自动选择是先用便宜模型试试、让几个模型并行出结果再汇总，还是让模型互相审查。核心是把一次 API 调用变成一个受控的微型协作流程，有预算上限、执行拓扑和失败处理策略。文章介绍了五种协作模式：Con...

## 推荐理由

vLLM 把语义路由升级成了模型协作引擎，对外还是一个 API 名，背后可以自动让便宜模型先试、多个模型并行出结果再汇总、或者互相审查。五种模式都带了预算控制和失败处理，对做推理优化的工程师很实用。没给更高分是因为这还只是博客文章，不是已发布的产品，而且正文没披露完整的性能对比数据，实际效果得打个问号。

## 锐评

这篇博文讲的是 vLLM 语义路由器的新玩法：它不再只是把请求分给最合适的模型，而是能在背后让多个模型协作，但对外只暴露一个模型名。用户照常调用 API，路由器会根据任务难度和预算，自动选择是先用便宜模型试试、让几个模型并行出结果再汇总，还是让模型互相审查。核心是把一次 API 调用变成一个受控的微型协作流程，有预算上限、执行拓扑和失败处理策略。

文章介绍了五种协作模式，比如“Confidence”是先用小模型，没信心再上大模型；“Ratings”是并行跑几个模型再按权重汇总。它声称这些模式在基准测试上能打败单个前沿模型，但正文没披露具体是哪些基准、分数是多少，也没给出成本对比。这点先别太激动，因为效果好坏很依赖任务类型和模型组合，没有数据支撑就只是概念验证。

还缺的是延迟和失败率的实测数据。多个模型串行或并行，响应时间肯定会涨，文章没提怎么控制延迟上限。另外，这种协作对提示词敏感，实际落地时调试成本不低。如果是真的能在不折腾应用代码的情况下稳定省钱提效，那对生产环境很有吸引力，但现在信息不够，只能当个方向看。
