# DeepSeek-V4.1 Flash：把 KV 缓存再压 4 倍，Prefill 只开 20 层

> 原标题：DeepSeek-v4.1 Flash: Pushing the Limits of KV Cache Compression

- 来源：Hacker News 首页
- 发布时间：2026-09-17T01:39:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56970
- 原文：https://zartbot.github.io/blog/model_arch/dsv41flash_arch/en.html

## 摘要

这篇技术报告拆解了 DeepSeek-V4.1 Flash 的架构，核心目标是把 KV 缓存压到极致。模型总参数 552B，但 Prefill 阶段只激活 8B 参数、跑 20 层，Decode 阶段激活 16B 参数。压缩手段包括跨层共享 KV（CSA2）、FP4 精度的 KV 缓存，以及稀疏注意力索引器的优化。作者认为改动幅度大到该叫 DeepSe...
