跳到正文
Computing Life · Share · 鸭哥调研

DeepSeek V4.1 Flash:长上下文成本的主战场,从算力转向内存

DeepSeek V4.1 Flash:算力优化触顶之后,长上下文的战争转向内存

DeepSeek 发了 V4.1 Flash,把全局 KV 缓存压到上一代的约四分之一,持久化缓存压到约八分之一,缓存命中的输入价格也跟着砍了六成。技术报告的核心判断是:稀疏注意力已经把计算成本打下来了,现在拖慢长时程 agent 任务的是显存塞满、数据往 SSD 搬进搬出和总线传输的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存、...

推荐理由:DeepSeek V4.1 Flash 不是例行降价。报告把 KV 缓存压到上一代的 1/4 到 1/8,缓存命中的输入价格跟着砍了六成。核心判断很明确:稀疏注意力已经把计算成本打下来了,现在卡住长时程 agent 任务的是显存塞满、数据在 SSD 和总线之间搬来搬去的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存,思路清晰,数字也够硬。对正在跑 agent 工作流的人来说,这比单纯降 token 单价更有参考价值——省的是显存和传输延迟,不是只省 API 账单。

读原文 ↗导出 Markdown