DeepSeek-V4.1 Flash:把 KV 缓存再压 4 倍,Prefill 只开 20 层
DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression
这篇技术报告拆解了 DeepSeek-V4.1 Flash 的架构,核心目标是把 KV 缓存压到极致。模型总参数 552B,但 Prefill 阶段只激活 8B 参数、跑 20 层,Decode 阶段激活 16B 参数。压缩手段包括跨层共享 KV(CSA2)、FP4 精度的 KV 缓存,以及稀疏注意力索引器的优化。作者认为改动幅度大到该叫 DeepSe...