# Baseten 实测 AI 生成推理引擎：Qwen-3.6-35B-A3B 单流解码比 vLLM 快最多 90%

> 原标题：Baseten 工程师实测：LLM 生成的推理引擎比 vLLM 快最多 90%

- 来源：AI HOT · 技巧与观点
- 发布时间：2026-10-02T21:09:34.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/ieywed84szmlk4rmk6tss0yxy
- 原文：https://www.baseten.co/blog/agentic-inference-optimization-faster-than-sota/

## 摘要

Baseten 工程师用 Claude Code 和 Fable 5 生成 VibeQwen 推理引擎，在单张 B200 上运行 NVFP4 精度的 Qwen-3.6-35B-A3B，单流解码速度比调优后的 vLLM 0.25.1 最多提升 90%。
