跳到正文
Hacker News 首页

DeepSeek-V4 发布当天,SGLang 和 Miles 就接好了推理和 RL 训练

DeepSeek-V4 on Day 0: From Fast Inference to Verified RL with SGLang and Miles

SGLang 和 Miles 团队在 DeepSeek-V4 发布当天就完成了推理和强化学习训练的适配,覆盖了 1.6T 参数的 Pro 版和 284B 参数的 Flash 版。V4 模型用了混合稀疏注意力,把滑动窗口和两种 KV 压缩(4:1 或 128:1)混在一起,撑住了 100 万 token 的上下文窗口,专家权重还用了 FP4 精度。系统上...

推荐理由:我会先打个折:这篇不是给所有人看的,系统细节多,普通读者容易走神。但它的钩子够硬——V4 发布当天就有推理加验证 RL 的工程栈,而且把上下文长度、压缩比、注意力窗口这些直接影响成本和稳定性的数字都摊开了。ShadowRadix 那部分虽然正文没展开实现细节,但点出了多池一致性这个真正难啃的骨头,对做部署和调优的人比单纯跑分更有参考价值。

读原文 ↗导出 Markdown