# DeepSeek V4 发布：1.6T 参数的 Pro 版和 284B 的 Flash 版，MIT 开源，支持 100 万 token 上下文

> 原标题：DeepSeek V4 just dropped, 1.6T Pro and 284B Flash, MIT license, 1M context. This is huge.

- 来源：r/LocalLLaMA
- 发布时间：2026-04-24T05:34:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9559
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1su6qpk/deepseek_v4_just_dropped_16t_pro_and_284b_flash/

## 摘要

DeepSeek 放出了两个 V4 模型，都走 MIT 开源协议，上下文窗口拉到 100 万 token。Pro 版总参数 1.6T，每次推理只激活 49B；Flash 版总参数 284B，激活 13B。激活参数占比很低，意味着如果跑分靠谱，自己部署长上下文模型的硬件门槛和成本会降一截。不过原帖没给具体跑分、定价、训练数据量，也没提实际推理吞吐，这些都...

## 推荐理由

这是 DeepSeek 旗舰级开源发布，两个 MIT 权重加 1M 上下文，当天覆盖没问题。分数停在 86，因为正文没披露基准分数、吞吐、训练数据规模或定价，这些缺口让实际效果还得等实测。我会先打个折，别看到 1.6T 就上头。

## 锐评

DeepSeek 这次放出的 V4 系列，最值得看的是激活参数占比极低。Pro 版总参数 1.6T，每次推理只激活 49B，相当于一个巨型专家库但实际干活的人很少，Flash 版更极端，284B 里只激活 13B。如果官方后续放出的跑分靠谱，这意味着自己部署长上下文模型的硬件门槛会降一截，1M 上下文窗口也不再是只有大厂才玩得起的东西。

但原帖正文被 Reddit 的安全策略挡了，实际内容没抓到，只看到标题和摘要。关键信息全缺：具体跑分、推理吞吐、显存占用、训练数据量、API 定价，一样都没披露。MIT 协议虽然友好，但没这些数字，没法判断是真实惠还是纸面便宜。

建议等 Hugging Face 上的技术报告和社区实测出来再下结论。重点盯两个数：单卡或双卡跑 Flash 版的实际 token 生成速度，以及 1M 上下文下的长文本召回率。这两项不翻车，才算真香。
