# Unsloth 放出 Qwen3.6 MTP GGUF 模型，推理速度提升超 1.4 倍

> 原标题：UnslothAI发布Qwen3.6 MTP GGUF模型，实现推理速度大幅提升

- 来源：AI HOT 精选
- 发布时间：2026-05-14T02:24:11.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/19937
- 原文：https://x.com/berryxia/status/2054749585520890314

## 摘要

Unsloth 创始人 Daniel Han 发了几个实验版 Qwen3.6 MTP GGUF 模型，用了一种叫“投机解码”的技术来加速推理。具体做法是让模型一次猜两个草稿 token（draft tokens=2），在速度和猜对率之间找了个平衡点。效果上，27B 模型在单张 GPU 上能跑到每秒 140 个 token，35B-A3B 版本能到每秒 ...

## 推荐理由

我会先打个折：正文只给了一条 X 动态，没披露用的什么 GPU、量化到几比特、怎么复现。所以分数停在低 featured 是合理的。但亮点很实在——用 MTP 投机解码把 27B 和 35B-A3B 的推理速度拉到一个单卡就能爽用的水平，对本地部署和低成本推理场景是个直接利好。这点先别太激动，等补上硬件和量化细节再往上调。

## 锐评

Daniel Han 放出的这几个 Qwen3.6 MTP GGUF 模型，核心卖点是推理快。27B 模型单张 GPU 跑到每秒 140 个 token，35B-A3B 版本能到 220 token/s，比原版 GGUF 快了 1.4 倍以上，而且说精度没掉。

快的原理是投机解码，让模型一次猜两个草稿 token，在速度和猜对率之间找了个平衡点。这个思路不新，但把 draft tokens 定在 2 并做成 GGUF 格式直接可用，对想在消费级显卡上跑大模型的人来说确实省事。

不过得打几个折。首先这是实验版，正文没提在哪些基准上验证过精度无损，也没说接受率具体是多少。其次，投机解码的实际加速效果很吃任务类型和硬件，换到长文本生成或复杂推理场景，220 token/s 这个数字不一定稳得住。另外，模型本身是 Qwen3.6 的衍生版，如果上游模型在特定任务上有短板，加速也解决不了。想用在生产环境，最好拿自己的数据和任务测一下延迟和输出质量，别只看峰值速度。
