# DeepSeek V4.1-Flash：763B 参数，用编码器-解码器新架构把预填充和解码拆开跑，还自带视觉

> 原标题：[AINews] DeepSeek v4.1-Flash: 763B-P8B-D16B novel causal Encoder–Decoder architecture with vision marks the Return of the Whale

- 来源：Latent Space
- 发布时间：2026-09-12T05:56:05.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56423
- 原文：https://www.latent.space/p/ainews-deepseek-v41-flash-763b-p8b

## 摘要

DeepSeek 在 9 月 10 号发了 V4.1-Flash，虽然叫 4.1，Sebastian Raschka 直接说这该叫 V5。模型总参数 763B，用了混合专家（MoE）和因果编码器-解码器架构，把处理输入和生成输出拆成了两个阶段：预填充时激活 8B 参数，解码时激活 16B 参数，稀疏度只有 1% 到 2%。这么一拆，KV 缓存占用最多能...

## 推荐理由

DeepSeek 发了 V4.1-Flash，763B 的因果编码器-解码器 MoE，预填充 8B 激活、解码 16B 激活，稀疏度 1%-2%，还带了视觉。Sebastian Raschka 说这该叫 V5，说明架构改动不小。国内旗舰模型架构更新，加上外部技术圈同步讨论，HKR 三条都踩中。没给 90 以上是因为刚发，还没看到实际跑分和落地反馈，先打个折。

## 锐评

这次更新最值得看的不是跑分，而是架构思路的转向。763B 总参数的混合专家模型，把预填充和解码拆开，分别激活 8B 和 16B 参数，稀疏度压到 1% 到 2%。这么做的直接好处是 KV 缓存占用大幅下降，原文说最多能比 V4 Flash 小 8 倍。对普通用户来说，这意味着模型在长对话或智能体任务里更省显存、延迟更低。

不过原文没放任何基准测试表格，作者自己也承认 V4.1-Flash 在某些榜单上跑不过其他开源模型。他们的解释是现有评测抓不住这个模型真正的长项——上下文利用效率。这个说法有道理，但也让判断变得困难：我们没法从数字上验证它到底省了多少成本、实际吞吐提升多大。

另外，DeepSeek 悄悄把 V4 Pro 下线了，等于全押在这套新架构上。加上原生支持视觉，不用再等单独的视觉模型，对开发者来说部署链路会简化不少。但正文没披露训练数据、推理成本和具体延迟数据，这些缺口让“更高效”的说法暂时只能打个折听。
