跳到正文
Computing Life · Share · 鸭哥调研

vLLM 和 TileRT 开始共用一套服务,推理引擎从“谁跑得快”转向“该走哪条路”

vLLM x TileRT:两个目标相反的推理引擎,为什么开始共用一套服务

vLLM 擅长把多个请求打包一起算,提高整体吞吐;TileRT 则专攻一次只处理一个请求的 decode,换取更低的逐 token 延迟。7 月 14 日,vLLM 官方博客公布了二者的解耦集成方案:vLLM 负责读提示词、做 prefill 并生成首 token,之后通过 MultiConnector 把标记为低延迟的请求转给 TileRT 完成后续...

推荐理由:vLLM 和 TileRT 的解耦集成把推理服务从单引擎比拼推到了按阶段分工的编排思路上,方案有具体机制和代码。不过这是官方博客的宣布稿,还没看到大规模生产环境的验证数据,实际能省多少延迟、多占多少资源都还不好说,这点先别太激动。

读原文 ↗导出 Markdown