# Qwen3.8-Flash-Next 在 Strix Halo 上跑满 100 万 token 上下文，解码速度 38 tok/s，但预填充要 18 分钟

> 原标题：Qwen3.8-Flash-Next at 1M context on Strix Halo: 38 tok/s decode, 18 min prefill (halogen 0.12.0)

- 来源：r/LocalLLaMA
- 发布时间：2026-09-19T21:49:45.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57623
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1wkyny9/qwen38flashnext_at_1m_context_on_strix_halo_38/

## 摘要

有人在 Strix Halo 上用 halogen 0.12.0 跑通了 Qwen3.8-Flash-Next 的 100 万 token 上下文。解码速度 38 tok/s，算能接受，但预填充花了整整 18 分钟——这个延迟没法交互使用。帖子没透露具体硬件配置和内存带宽，所以不好判断瓶颈在哪。能跑到 1M 上下文本身是个里程碑，但预填充不优化的话，离...
