vLLM 搞了个 Micro-Agent:让多个模型在 API 内部组队干活,效果能超过单个顶尖模型
Micro-Agent: Beat Frontier Models with Collaboration Inside Model API
vLLM 的语义路由器现在不只是把请求分给最合适的模型,它还能让多个模型在背后协作,但对外只暴露一个模型名。用户照常调用 API,路由器会根据任务难度和预算,自动选择是先用便宜模型试试、让几个模型并行出结果再汇总,还是让模型互相审查。核心是把一次 API 调用变成一个受控的微型协作流程,有预算上限、执行拓扑和失败处理策略。文章介绍了五种协作模式:Con...
推荐理由:vLLM 把语义路由升级成了模型协作引擎,对外还是一个 API 名,背后可以自动让便宜模型先试、多个模型并行出结果再汇总、或者互相审查。五种模式都带了预算控制和失败处理,对做推理优化的工程师很实用。没给更高分是因为这还只是博客文章,不是已发布的产品,而且正文没披露完整的性能对比数据,实际效果得打个问号。