# SGLang 接入 DSpark 推测解码：让草稿模型自己决定每次验证几个 token

> 原标题：SGLang 集成 DSpark 推测解码：置信度驱动的可变长度验证

- 来源：AI HOT 精选
- 发布时间：2026-07-06T17:11:47.280Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/42736
- 原文：https://www.lmsys.org/blog/2026-07-06-dspark-sglang

## 摘要

LMSYS 把 DSpark 推测解码做进了 SGLang 推理引擎。和以前固定验证一整块 token 不同，DSpark 的草稿模型自带一个“信心打分器”，能算出每个 token 被主模型接受的概率，调度器再根据这个分数动态决定每轮实际验证几个 token——分数低的请求就少验几个，省下算力。在 H200 上跑 DeepSeek-V4-Flash，这...

## 推荐理由

LMSYS 把 DSpark 做进了 SGLang，还给了 H200 上的实测数字，不是论文预告而是引擎级落地。硬核和知识增量都够，但话题局限在推理加速，圈外人无感，所以 R 没给，分数卡在 featured 门槛 78 分。

## 锐评

LMSYS 把 DSpark 推测解码集成进了 SGLang，核心变化是验证长度不再固定。草稿模型多了一个“信心打分器”，能算出每个 token 被主模型接受的概率，调度器再根据这个分数动态决定每轮实际验证几个 token——分数低的请求就少验几个，把算力省下来。在 H200 上跑 DeepSeek-V4-Flash，这套方案在吞吐和每位用户解码速度上都超过了 MTP 和不做推测的基线。

工程上最值得看的是他们怎么在完整的 CUDA 图里跑可变长度验证：当调度器砍掉验证预算时，引擎会重放一个真正更小的图，而不是用填充来假装变小，这避免了无效计算。另外，调度器靠一个成本表在线决定每个请求的验证预算，还有一个“上限接受模式”用来暴露被裁剪隐藏的真实接受率天花板。

正文没披露具体的延迟数字和成本表细节，也没说这套方案在非 H200 硬件或更混合的流量下的表现。动态调度比固定调度的提升幅度也只给了初步观察，缺少严格的消融实验。
