# 单张 MI50 跑 Qwen3.6-27B 速度翻倍：从 19.4 涨到 38.1 token/秒

> 原标题：2X tk/s (from 19.4 -&gt; 38.1 tk/s on 1 x MI50) Playing with a hypothesis like speculative decoding.. but instead of an additional side model, exploiting that I can run multiple computations side-by-side AS IF I had Qwen3.6-27B loaded twice in memory - small quants don't use all the available compute.

- 来源：r/LocalLLaMA
- 发布时间：2026-06-09T01:50:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35708
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u0rk0o/2x_tks_from_194_381_tks_on_1_x_mi50_playing_with/

## 摘要

有个玩家在单张 AMD MI50 上跑 Qwen3.6-27B 模型，用 Q8 或更低精度的量化版本时，发现显卡的算力没吃满。他想到一个取巧的办法：不额外加载一个小模型做投机解码，而是让同一个模型同时跑两路计算，假装自己有两份模型副本。结果生成速度直接从 19.4 token/秒翻到 38.1 token/秒。正文没披露具体实现细节和显存占用变化，所以...

## 推荐理由

这是个 Reddit 玩家的第一手实验，有数字有假设，但没经过正式验证。正文没披露具体实现细节和显存变化，也没有代码或更广的复现结果，所以先放在 featured 这一档。

## 锐评

这个思路挺取巧：既然小量化模型（Q8或更低）吃不满MI50的算力，与其额外加载一个小模型做投机解码，不如让同一个模型同时跑两路计算，假装自己有两份副本。结果生成速度直接从19.4 token/秒翻到38.1 token/秒，翻倍效果很直观。

但关键信息全卡在Reddit的403屏蔽页里了。正文没披露具体实现方式——是改了推理框架的调度，还是用vLLM之类的批处理引擎？显存占用增加了多少？延迟有没有变差？这些全看不到。另外，这个方法只适用于算力有闲置的场景，如果模型量化精度高、已经吃满显卡，可能就没这便宜可占了。

对跑本地模型的玩家来说，如果确认自己的卡在跑小量化时利用率不满，这个方向值得试试。但得等作者把实现细节放出来，或者有人复现验证，才知道是不是真能稳定用。
