跳到正文
Hacker News 首页

DeepSeek-V4.1 Flash:把 KV 缓存再压 4 倍,Prefill 只开 20 层

DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression

这篇技术报告拆解了 DeepSeek-V4.1 Flash 的架构,核心目标是把 KV 缓存压到极致。模型总参数 552B,但 Prefill 阶段只激活 8B 参数、跑 20 层,Decode 阶段激活 16B 参数。压缩手段包括跨层共享 KV(CSA2)、FP4 精度的 KV 缓存,以及稀疏注意力索引器的优化。作者认为改动幅度大到该叫 DeepSe...

读原文 ↗导出 Markdown