# DeepSeek 放出 V4.1-Flash：一口气能读百万 token，靠压缩缓存和复用注意力省资源

> 原标题：DeepSeek AI 发布 DeepSeek-V4.1-Flash：1M 上下文、FP4 KV 缓存与跨层注意力复用

- 来源：AI HOT 精选
- 发布时间：2026-09-10T07:31:01.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55682
- 原文：https://www.marktechpost.com/2026/09/10/deepseek-ai-released-deepseek-v4-1-flash-with-1m-context-fp4-kv-cache-and-cross-layer-attention-reuse

## 摘要

DeepSeek 发了个新模型 V4.1-Flash，主打长文本处理。它支持一次性读入 100 万 token 的上下文，相当于能直接啃完《三体》三部曲。为了不让显存爆炸，它用了 FP4 精度存 KV 缓存，把临时记忆压得很小；同时让不同层之间复用注意力计算结果，省掉不少重复运算。不过正文没披露参数量、跑分成绩、开源协议和 API 定价，所以实际效果和...

## 推荐理由

DeepSeek 扔了个 V4.1-Flash，一口气能读 100 万 token，相当于整本《三体》塞进去。为了省显存，KV 缓存用 FP4 精度压得很小，还让不同层之间复用注意力结果，省掉重复计算。这几个工程点组合在一起确实有点意思，但正文没披露参数量、跑分、开源协议和定价，实际效果和性价比都得打个问号，所以先放在 featured 级别观望。
