跳到正文
r/LocalLLaMA

Qwen3.8-Flash-Next 在 Strix Halo 上跑满 100 万 token 上下文,解码速度 38 tok/s,但预填充要 18 分钟

Qwen3.8-Flash-Next at 1M context on Strix Halo: 38 tok/s decode, 18 min prefill (halogen 0.12.0)

有人在 Strix Halo 上用 halogen 0.12.0 跑通了 Qwen3.8-Flash-Next 的 100 万 token 上下文。解码速度 38 tok/s,算能接受,但预填充花了整整 18 分钟——这个延迟没法交互使用。帖子没透露具体硬件配置和内存带宽,所以不好判断瓶颈在哪。能跑到 1M 上下文本身是个里程碑,但预填充不优化的话,离...

读原文 ↗导出 Markdown