Qwen3.8-Flash-Next:256K 上下文,DDR4 内存 + T4 显卡跑出 16 tok/s
Qwen3.8-Flash-Next: 256k context, 16tok/s on DDR4 and a Tesla T4
Qwen3.8-Flash-Next 在 DDR4 内存和一张 Tesla T4 显卡上跑出了 16 tok/s 的速度,同时支持 256K 上下文。这个组合意味着长上下文模型可以在很便宜的硬件上本地跑,适合个人部署或边缘场景。不过帖子被 Reddit 屏蔽了,正文没披露架构、训练方法或发布日期,所以目前只能看个热闹,别急着下结论。