DeepSeek V4 发布:1.6T 参数的 Pro 版和 284B 的 Flash 版,MIT 开源,支持 100 万 token 上下文
DeepSeek V4 just dropped, 1.6T Pro and 284B Flash, MIT license, 1M context. This is huge.
DeepSeek 放出了两个 V4 模型,都走 MIT 开源协议,上下文窗口拉到 100 万 token。Pro 版总参数 1.6T,每次推理只激活 49B;Flash 版总参数 284B,激活 13B。激活参数占比很低,意味着如果跑分靠谱,自己部署长上下文模型的硬件门槛和成本会降一截。不过原帖没给具体跑分、定价、训练数据量,也没提实际推理吞吐,这些都...
推荐理由:这是 DeepSeek 旗舰级开源发布,两个 MIT 权重加 1M 上下文,当天覆盖没问题。分数停在 86,因为正文没披露基准分数、吞吐、训练数据规模或定价,这些缺口让实际效果还得等实测。我会先打个折,别看到 1.6T 就上头。