Unsloth 放出 Qwen3.6 MTP GGUF 模型,推理速度提升超 1.4 倍
UnslothAI发布Qwen3.6 MTP GGUF模型,实现推理速度大幅提升
Unsloth 创始人 Daniel Han 发了几个实验版 Qwen3.6 MTP GGUF 模型,用了一种叫“投机解码”的技术来加速推理。具体做法是让模型一次猜两个草稿 token(draft tokens=2),在速度和猜对率之间找了个平衡点。效果上,27B 模型在单张 GPU 上能跑到每秒 140 个 token,35B-A3B 版本能到每秒 ...
推荐理由:我会先打个折:正文只给了一条 X 动态,没披露用的什么 GPU、量化到几比特、怎么复现。所以分数停在低 featured 是合理的。但亮点很实在——用 MTP 投机解码把 27B 和 35B-A3B 的推理速度拉到一个单卡就能爽用的水平,对本地部署和低成本推理场景是个直接利好。这点先别太激动,等补上硬件和量化细节再往上调。