跳到正文
AI HOT 精选

DeepSeek 放出 V4.1-Flash:一口气能读百万 token,靠压缩缓存和复用注意力省资源

DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

DeepSeek 发了个新模型 V4.1-Flash,主打长文本处理。它支持一次性读入 100 万 token 的上下文,相当于能直接啃完《三体》三部曲。为了不让显存爆炸,它用了 FP4 精度存 KV 缓存,把临时记忆压得很小;同时让不同层之间复用注意力计算结果,省掉不少重复运算。不过正文没披露参数量、跑分成绩、开源协议和 API 定价,所以实际效果和...

推荐理由:DeepSeek 扔了个 V4.1-Flash,一口气能读 100 万 token,相当于整本《三体》塞进去。为了省显存,KV 缓存用 FP4 精度压得很小,还让不同层之间复用注意力结果,省掉重复计算。这几个工程点组合在一起确实有点意思,但正文没披露参数量、跑分、开源协议和定价,实际效果和性价比都得打个问号,所以先放在 featured 级别观望。

读原文 ↗导出 Markdown