跳到正文
AI HOT 精选

Qwen 开源 Qwen3.8-Flash-Next:总参数 125B,每次只激活 6B,提前预览 Qwen4 架构

Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览

Qwen 放出了 Qwen3.8-Flash-Next 的权重,这是 Qwen4 架构的早期预览版。模型总参数 125B,但每次推理只激活 6B 参数,另外还带了一个 51B 的 N-gram 词表,可以卸载到内存里异步调用,不占显存。架构上改了四处:注意力层换成 Gated DeltaNet 加 Qwen 稀疏注意力,前者压缩长历史,后者用轻量索引挑...

推荐理由:Qwen 放出了 Qwen3.8-Flash-Next 权重,是 Qwen4 架构的早期预览。125B 总参数,每次推理只激活 6B,外加一个 51B 的 N-gram 词表可以卸载到内存异步调用,不占显存,部署成本会低不少。架构上改了四处,注意力层换成 Gated DeltaNet 加稀疏注意力,前者压缩长历史,后者用轻量索引挑 token,属于新机制落地。对做推理部署和关注国产开源模型进展的人来说,这是提前看 Qwen4 技术路线的窗口。信息来自官方发布,没有披露具体 benchmark 分数,这点先别太激动。

读原文 ↗导出 Markdown