跳到正文
AI HOT · 技巧与观点

Baseten 实测 AI 生成推理引擎:Qwen-3.6-35B-A3B 单流解码比 vLLM 快最多 90%

Baseten 工程师实测:LLM 生成的推理引擎比 vLLM 快最多 90%

Baseten 工程师用 Claude Code 和 Fable 5 生成 VibeQwen 推理引擎,在单张 B200 上运行 NVFP4 精度的 Qwen-3.6-35B-A3B,单流解码速度比调优后的 vLLM 0.25.1 最多提升 90%。

读原文 ↗导出 Markdown