# DeepSeek-V4 发布当天，SGLang 和 Miles 就接好了推理和 RL 训练

> 原标题：DeepSeek-V4 on Day 0: From Fast Inference to Verified RL with SGLang and Miles

- 来源：Hacker News 首页
- 发布时间：2026-04-25T23:44:05.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9907
- 原文：https://www.lmsys.org/blog/2026-04-25-deepseek-v4/

## 摘要

SGLang 和 Miles 团队在 DeepSeek-V4 发布当天就完成了推理和强化学习训练的适配，覆盖了 1.6T 参数的 Pro 版和 284B 参数的 Flash 版。V4 模型用了混合稀疏注意力，把滑动窗口和两种 KV 压缩（4:1 或 128:1）混在一起，撑住了 100 万 token 的上下文窗口，专家权重还用了 FP4 精度。系统上...

## 推荐理由

我会先打个折：这篇不是给所有人看的，系统细节多，普通读者容易走神。但它的钩子够硬——V4 发布当天就有推理加验证 RL 的工程栈，而且把上下文长度、压缩比、注意力窗口这些直接影响成本和稳定性的数字都摊开了。ShadowRadix 那部分虽然正文没展开实现细节，但点出了多池一致性这个真正难啃的骨头，对做部署和调优的人比单纯跑分更有参考价值。

## 锐评

这条博客讲的是工程落地，不是模型评测。SGLang 和 Miles 团队在 V4 发布当天就完成了推理和强化学习训练的适配，覆盖了 1.6T 参数的 Pro 版和 284B 参数的 Flash 版。V4 模型本身用了混合稀疏注意力，把滑动窗口和两种 KV 压缩（4:1 或 128:1）混在一起，撑住了 100 万 token 的上下文窗口，专家权重还用了 FP4 精度。系统上，他们搞了个叫 ShadowRadix 的机制，能在三种 KV 缓存池和两种压缩状态池之间保持一致性，这是让长上下文跑起来的关键。

博客里放了一张对比图，显示 SGLang 在 30K token 的《红楼梦》片段上，解码吞吐量比另一个开源引擎高。但要注意，这是他们自己测的，对比的“另一个引擎”没点名，测试配置也说是按官方配方尽力调的，具体公平性得打个问号。正文没披露延迟数据，也没说在真实多轮对话场景下的表现。

RL 训练这边，他们支持了 FP8 训练和全并行策略，但只给了一个训练结果图，没给收敛曲线、训练成本或与 V3 的对比。整体看，这套工具链对想第一时间用上 V4 的团队是实打实的便利，但性能数据目前只有单方口径，缺第三方复现和更多场景的验证。
