跳到正文
Latent Space

DeepSeek V4.1-Flash:763B 参数,用编码器-解码器新架构把预填充和解码拆开跑,还自带视觉

[AINews] DeepSeek v4.1-Flash: 763B-P8B-D16B novel causal Encoder–Decoder architecture with vision marks the Return of the Whale

DeepSeek 在 9 月 10 号发了 V4.1-Flash,虽然叫 4.1,Sebastian Raschka 直接说这该叫 V5。模型总参数 763B,用了混合专家(MoE)和因果编码器-解码器架构,把处理输入和生成输出拆成了两个阶段:预填充时激活 8B 参数,解码时激活 16B 参数,稀疏度只有 1% 到 2%。这么一拆,KV 缓存占用最多能...

推荐理由:DeepSeek 发了 V4.1-Flash,763B 的因果编码器-解码器 MoE,预填充 8B 激活、解码 16B 激活,稀疏度 1%-2%,还带了视觉。Sebastian Raschka 说这该叫 V5,说明架构改动不小。国内旗舰模型架构更新,加上外部技术圈同步讨论,HKR 三条都踩中。没给 90 以上是因为刚发,还没看到实际跑分和落地反馈,先打个折。

读原文 ↗导出 Markdown