# SpecForge v0.3 发布：把草稿模型训练从主模型上拆下来，还带了一批开源草稿模型

> 原标题：SpecForge v0.3.0 发布：统一解耦与共置投机解码栈，新增开放 SpecBundle 草稿模型

- 来源：AI HOT 精选
- 发布时间：2026-08-04T17:51:09.590Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48692
- 原文：https://www.lmsys.org/blog/2026-08-04-specforge-v0-3

## 摘要

LMSYS 把 SpecForge 的训练流程拆成了两拨独立资源：打补丁的 SGLang 服务器负责从目标模型抓特征，Mooncake 负责传数据，训练节点只管吃特征训练草稿模型。在 8 张 H20 的测试环境里，3 台服务器加 5 个训练节点的吞吐比之前绑在一起的方案高了约 10%。这次更新还一口气支持了 EAGLE3、DFlash、Domino、D...

## 推荐理由

LMSYS 这次把 SpecForge 的训练流程拆成了三块独立资源——抓特征、传数据、训草稿模型——在 8 张 H20 上跑出了约 10% 的吞吐提升，数字和架构都实在。但话题本身太底层，只对做推理优化的那拨人有直接价值，所以给了 featured 但没给 r。

## 锐评

SpecForge 这次更新解决了一个很实际的工程痛点：以前训草稿模型时，目标模型的推理和草稿模型的训练得挤在同一套资源里，互相拖慢速度。v0.3 把这两件事拆成了独立的资源池——用打了补丁的 SGLang 服务器专门抓目标模型的特征，通过 Mooncake 传输数据，训练节点只管吃特征训练。在 8 张 H20 的测试环境里，3 台服务器加 5 个训练节点的组合，端到端训练吞吐比之前绑在一起的方案高了约 10%。这个提升不算夸张，但考虑到只是架构解耦带来的，没有换硬件，算是实在的收益。

另一个变化是草稿模型的支持范围一下子拉宽了，从之前主要围绕 EAGLE3，扩展到 DFlash、Domino、DSpark 等六种方案。这意味着用户不用为了试不同算法去搭不同的训练管线，一套配置就能切换。他们还放出了一批用完全公开数据训好的草稿模型，这点对想复现或做对比的人比较友好。

不过正文没给出这些草稿模型在真实推理场景下的接受率或加速比数据，只提了训练侧的吞吐改善。实际部署能省多少推理时间，还得看后续的 serving 端评测。另外，解耦方案依赖 Mooncake 做数据传输，这套组件本身的稳定性和额外延迟在更大规模集群上的表现，文章也没展开。
