跳到正文
r/LocalLLaMA

Qwen3.8-Flash-Next 跑在笔记本+外接显卡上,速度从22飙到84 tok/s,离双3090服务器只差一道编程题

Qwen3.8-Flash-Next (104 GB MoE) on a Strix Halo + RTX 3090 Ti eGPU: 22 -> 84 tok/s, and within one HumanEval+ problem of a dual-3090 vLLM box at 0.4x the wall time

有人在 Strix Halo 笔记本上外挂一块 RTX 3090 Ti,跑通 104GB 的 MoE 模型 Qwen3.8-Flash-Next,推理速度从纯笔记本的 22 tok/s 拉到 84 tok/s。对比双 3090 的 vLLM 服务器,HumanEval+ 编程测试只差一道题,而且总耗时只有服务器的 0.4 倍——如果是真的挺省钱。不过原...

读原文 ↗导出 Markdown