跳到正文
Hacker News 首页

vLLM 在 AMD GPU 上试了五种“猜词加速”方案,吞吐最高能翻倍

Speculative Decoding in vLLM on AMD GPUs

vLLM 在 AMD MI300X 上测了推测解码(让一个小模型先快速猜一串 token,大模型一次验证,能一次吐出多个 token)。他们试了五种猜法:原生 MTP、Gemma 4 MTP、EAGLE-3、DFlash 和 DSpark,区别在于小模型怎么从大模型拿信息、以及是一次猜一个还是一串猜。结果吞吐提升幅度差别很大,取决于猜法、猜多长、模型类...

读原文 ↗导出 Markdown