# DeepSeek V4.1 Flash：长上下文成本的主战场，从算力转向内存

> 原标题：DeepSeek V4.1 Flash：算力优化触顶之后，长上下文的战争转向内存

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-09-11T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56067
- 原文：https://yage.ai/share/deepseek-v41-flash-kv-cache-memory-20260911.html

## 摘要

DeepSeek 发了 V4.1 Flash，把全局 KV 缓存压到上一代的约四分之一，持久化缓存压到约八分之一，缓存命中的输入价格也跟着砍了六成。技术报告的核心判断是：稀疏注意力已经把计算成本打下来了，现在拖慢长时程 agent 任务的是显存塞满、数据往 SSD 搬进搬出和总线传输的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存、...

## 推荐理由

DeepSeek V4.1 Flash 不是例行降价。报告把 KV 缓存压到上一代的 1/4 到 1/8，缓存命中的输入价格跟着砍了六成。核心判断很明确：稀疏注意力已经把计算成本打下来了，现在卡住长时程 agent 任务的是显存塞满、数据在 SSD 和总线之间搬来搬去的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存，思路清晰，数字也够硬。对正在跑 agent 工作流的人来说，这比单纯降 token 单价更有参考价值——省的是显存和传输延迟，不是只省 API 账单。

## 锐评

这份报告讲了一个很清晰的逻辑：稀疏注意力已经把计算成本打下来了，现在拖慢长时程agent任务的是显存塞满、数据往SSD搬进搬出和总线传输的开销。DeepSeek的解法是上4位存储、让不同层共用一份全局缓存、取消滑动窗口的磁盘写入，三刀砍下去，全局KV缓存压到上一代的约四分之一，持久化缓存压到约八分之一，缓存命中的输入价格也跟着砍了六成。

但这里有几个点要先打个折。所有吞吐倍率和削减比例都是DeepSeek自报的，没有独立第三方复核。报告自己也承认，跨层复用可能带来位置选择偏差，极端长上下文下缓存重建有性能劣化风险。另外有第三方实测发现，模型跑复杂逻辑任务时倾向于派生大量子agent，导致调用token总量激增，这和报告里单次调用成本下探不是一回事。

对部署者来说，这份报告最大的价值不是那几个压缩数字，而是把长上下文服务的账单逐项摊开了：预填充算力、显存常驻、外存落盘、总线搬运。你的业务到底是读多写少还是实时往复，在这套公式下算出的最优解完全不同。正文没披露不同负载形态下的实际端到端延迟和吞吐数据，也没给出缓存命中率在不同场景下的分布，这些才是选型时真正要看的硬指标。
