Baseten 实测 AI 生成推理引擎:Qwen-3.6-35B-A3B 单流解码比 vLLM 快最多 90%
Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%
Baseten 工程师用 Claude Code 和 Fable 5 生成 VibeQwen 推理引擎,在单张 B200 上运行 NVFP4 精度的 Qwen-3.6-35B-A3B,单流解码速度比调优后的 vLLM 0.25.1 最多提升 90%。
Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%
Baseten 工程师用 Claude Code 和 Fable 5 生成 VibeQwen 推理引擎,在单张 B200 上运行 NVFP4 精度的 Qwen-3.6-35B-A3B,单流解码速度比调优后的 vLLM 0.25.1 最多提升 90%。