# vLLM 在 AMD GPU 上试了五种“猜词加速”方案，吞吐最高能翻倍

> 原标题：Speculative Decoding in vLLM on AMD GPUs

- 来源：Hacker News 首页
- 发布时间：2026-09-07T09:26:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55288
- 原文：https://vllm.ai/blog/2026-08-23-speculative-decoding-amd-gpus

## 摘要

vLLM 在 AMD MI300X 上测了推测解码（让一个小模型先快速猜一串 token，大模型一次验证，能一次吐出多个 token）。他们试了五种猜法：原生 MTP、Gemma 4 MTP、EAGLE-3、DFlash 和 DSpark，区别在于小模型怎么从大模型拿信息、以及是一次猜一个还是一串猜。结果吞吐提升幅度差别很大，取决于猜法、猜多长、模型类...
