通义千问放出 Qwen3.8-Flash,125B 参数每次只用 6B,训练费打骨折
通义千问发布 Qwen3.8-Flash,多模态 MoE 模型,Qwen4 架构早期预览
Qwen3.8-Flash 是 Qwen4 架构的早期预览版,总参数 125B,但每次推理只激活 6B 参数,相当于用很小的算力跑一个大模型。原生上下文窗口 262K,能拉到 1M。训练成本只有 Qwen3.7-Plus 的九分之一,官方说写代码和办公任务表现反而更好。权重已经开放。正文没给具体跑分和开源协议细节,这点先别太激动。
推荐理由:通义千问放出 Qwen3.8-Flash,是 Qwen4 架构的早期预览版。125B 总参数只激活 6B,训练成本降到前代的九分之一,官方说写代码和办公任务表现更好,权重已开放。效率数字很具体,但正文没披露具体跑分和开源协议细节,这点先别太激动,实际效果得自己跑一下。