DeepSeek发布V4.1Flash模型,优化长上下文处理能力
先了解这件事
DeepSeek 今天上线了 V4.1-Flash,这是他们全新模型架构里最小的一个,自带看图能力。新架构的设计目标是拉高能力天花板、跑得更快、吞吐量更大,后续会放大到更大参数的模型上。跑分方面,GPQA Diamond 90.9,Codeforces 3471,HLE 36.8,在编程和 Agent 任务上看着挺能打。API 这边,模型名改成 dee...
摘自 AI HOT 精选
报道时间线
沿着报道,了解事件的不同侧面。
- Latent Space精选DeepSeek V4.1-Flash:763B 参数,用编码器-解码器新架构把预填充和解码拆开跑,还自带视觉
DeepSeek 在 9 月 10 号发了 V4.1-Flash,虽然叫 4.1,Sebastian Raschka 直接说这该叫 V5。模型总参数 763B,用了混合专家(MoE)和因果编码器-解码器架构,把处理输入和生成输出拆成了两个阶段:预填充时激活 8B 参数,解码时激活 16B 参数,稀疏度只有 1% 到 2%。这么一拆,KV 缓存占用最多能...
- AI HOT 精选精选DeepSeek 开源 V4.1-Flash:用不对称算力给编程 Agent 省 prefill 成本
DeepSeek 放出了 V4.1-Flash 的开放权重,一个 552B 参数的 MoE 模型,用了 Causal Encoder-Decoder 架构,专门为编程 Agent 调过。它把算力拆成两块:prefill 阶段激活 8B 参数,decode 阶段激活 16B,外加 KV 缓存效率也做了优化。跑分上,Terminal Bench 2.1 拿...
- AI HOT 精选DeepSeek V4.1 Flash 实测:降价还带视觉,游戏和城市生成都能跑
文章标题说 DeepSeek V4.1 Flash 大幅降价、原生支持视觉能力,作者用游戏和城市生成任务测了表现。但正文被微信屏蔽,看不到具体降了多少、视觉能力什么规格、生成质量如何。如果真降价且视觉好用,对做多模态或生成类应用的团队是个好消息,但这点先别太激动——没披露细节前只能当传闻看。
- Computing Life · Share · 鸭哥调研精选DeepSeek V4.1 Flash:长上下文成本的主战场,从算力转向内存
DeepSeek 发了 V4.1 Flash,把全局 KV 缓存压到上一代的约四分之一,持久化缓存压到约八分之一,缓存命中的输入价格也跟着砍了六成。技术报告的核心判断是:稀疏注意力已经把计算成本打下来了,现在拖慢长时程 agent 任务的是显存塞满、数据往 SSD 搬进搬出和总线传输的开销。Flash 的解法是上 4 位存储、让不同层共用一份全局缓存、...
- AI HOT 精选精选DeepSeek V4.1 Flash 在 Intelligence Index 拿到 40 分,把自家 V4 Pro 0813 挤下旗舰位
Artificial Analysis 的评测里,DeepSeek V4.1 Flash 综合智力评分 40,比之前的旗舰 V4 Pro 0813 还高一点,成了 DeepSeek 目前得分最高的模型。它干活时输入只激活 80 亿参数、输出激活 160 亿参数,能一口气处理 100 万 token 的上下文,代码直接 MIT 开源。不过正文没提推理速度...
- AI HOT 精选精选DeepSeek-V4.1-Flash 在硅基流动上线,552B 参数、1M 上下文,KV 缓存砍到 V4 Flash 的四分之一
硅基流动当天就接入了 DeepSeek-V4.1-Flash。这是个 552B 参数的混合专家模型,实际干活时预填充阶段激活约 80 亿参数,解码阶段约 160 亿参数,自带视觉能力,一次能处理 100 万 token 的上下文。最实在的一点是 KV 缓存占用只有 V4 Flash 的四分之一,部署成本会低不少。MIT 许可证,商用也方便。
- AI HOT 精选精选DeepSeek 发布 V4.1-Flash,把 AI 智能体的内存开销砍到前代的四分之一
DeepSeek 新模型 V4.1-Flash 主要解决长文本处理太烧钱的问题。它把 GPU 高速内存里的 KV 缓存(模型处理过的上下文暂存区)压到了前代 V4-Flash 的四分之一,卸载到硬盘或主机内存的部分更是缩到约八分之一。具体做法是把模型拆成编码器和解码器:读入信息时每 token 只激活 80 亿参数,生成文字时才用到 160 亿,输入端...
- AI HOT 精选精选DeepSeek 发布 V4.1-Flash:新架构让模型自带看图能力,不再外挂视觉模块
DeepSeek 推出了 V4.1-Flash,换了一套叫“因果编码器-解码器”的新架构,直接把视觉理解做进了模型里,不用再单独接一个看图组件。模型总规模 552B 参数,是个混合专家模型,处理你输入的内容时只激活 8B 参数,生成回答时激活 16B。官方说价格降了不少,但正文没给出具体降幅和跑分数据,我会先打个折,等第三方实测出来再看。
- AI HOT 精选精选DeepSeek 出了个 V4.1-Flash,用新架构把视觉理解直接做进模型里,KV 缓存砍到原来的 1/4
V4.1-Flash 是 DeepSeek 新架构里最小的一个模型,总参数 552B,但干活时输入只激活 8B、输出激活 16B,属于 MoE 的省电模式。它换了一套叫 Causal Encoder-Decoder 的架构,视觉理解不再外挂,而是原生支持。最实在的变化是 KV 缓存:跟上一代比,HBM 占用降到 1/4,SSD 存储降到 1/8,意味着...
- AI HOT 精选精选DeepSeek 放出 V4.1-Flash:一口气能读百万 token,靠压缩缓存和复用注意力省资源
DeepSeek 发了个新模型 V4.1-Flash,主打长文本处理。它支持一次性读入 100 万 token 的上下文,相当于能直接啃完《三体》三部曲。为了不让显存爆炸,它用了 FP4 精度存 KV 缓存,把临时记忆压得很小;同时让不同层之间复用注意力计算结果,省掉不少重复运算。不过正文没披露参数量、跑分成绩、开源协议和 API 定价,所以实际效果和...
- r/LocalLLaMA精选DeepSeek 发了个 V4.1 Flash:跑分超自家 Pro,API 降价,模型还开源了
DeepSeek 今天放出了 V4.1 Flash,一个总参数 552B 的 MoE 模型,但实际干活时输入只激活 8B、输出激活 16B 参数,所以推理成本压得很低。它用了新的非对称编码器-解码器架构,跑分直接超过了自家的 V4 Pro。KV 缓存也大幅瘦身,相比上代 HBM 需求降到 1/4、SSD 需求降到 1/8,这对经常要缓存命中的 agen...
- Hacker News 首页精选DeepSeek 在 HuggingFace 上发布了 V4.1 Flash 模型
DeepSeek 放出了一个叫 V4.1 Flash 的新模型,代码和权重挂在 HuggingFace 上。正文没披露参数量、跑分成绩和具体架构,所以现在还不知道它到底多大、多强。从命名习惯看,带“Flash”通常意味着这是个更快、更轻量的版本,可能适合需要低延迟或者本地跑的场景。Hacker News 上讨论热度很高,853 分、481 条评论,但大...
- AI HOT 精选精选DeepSeek 发布 V4.1-Flash,新架构小模型,API 降价并直接替代 V4 Pro
DeepSeek 今天上线了 V4.1-Flash,这是他们全新模型架构里最小的一个,自带看图能力。新架构的设计目标是拉高能力天花板、跑得更快、吞吐量更大,后续会放大到更大参数的模型上。跑分方面,GPQA Diamond 90.9,Codeforces 3471,HLE 36.8,在编程和 Agent 任务上看着挺能打。API 这边,模型名改成 dee...