DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型,主打 KV cache 压缩
DeepSeek-V4.1-Flash 发布:552B MoE 多模态模型主打 KV cache 压缩
DeepSeek 发了 V4.1-Flash,一个 552B 参数的 MoE 多模态模型,核心卖点是 KV cache 压缩——就是减少长文本推理时显存占用,让大模型跑长上下文更省显存。论文刚挂 arXiv,压缩比和跑分都没给,标题说“Pushing the Limits”,方向是推理效率。正文没披露具体压缩效果和评测结果,这点先别太激动。