# 网友用百万级 token 实测 Qwen 3.6 35B MTP 版，速度比之前快了约一半

> 原标题：Used over a million tokens in three separate sessions to test Qwen 3.6 35b (new Multi-token Prediction version)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-15T06:20:08.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/21391
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tdns1i/used_over_a_million_tokens_in_three_separate/

## 摘要

一位 Reddit 用户分三次跑了超过一百万 token 来测 Qwen3.6-35B-A3B 的多 token 预测（MTP）版本，上下文拉到 300k，量化用 KV Q8_0。他给出的结论是生成速度大概比之前测过的版本快了 1.5 倍。不过帖子正文被 Reddit 的安全策略挡了，看不到具体测试环境、硬件配置和任务类型，所以这个提速是在什么条件下跑...

## 推荐理由

一个 Reddit 用户拿 Qwen3.6-35B-A3B MTP 版跑了三轮百万 token 的测试，在 300k 上下文、KV Q8_0 量化下，速度大概是旧测试的 1.5 倍。这个多 token 预测版（一次预测多个 token）确实在本地跑出了可感知的加速，但正文没披露功耗、显存占用和不同量化级别的对比，所以这个 1.5 倍先别太激动，得看自己硬件上复现怎么样。帖子本身有细节、有实测，对想省钱跑长上下文的开发者有参考价值，但毕竟只是单篇个人测试，重要性我给 74。

## 锐评

这条测试结果值得关注，但信息缺口太大，我会先打个折。一位 Reddit 用户用 Qwen3.6-35B-A3B 的多 token 预测（MTP）版本跑了三次、总计超一百万 token 的测试，上下文拉到 300k，量化用 KV Q8_0，结论是生成速度比之前测过的版本快了约 1.5 倍。MTP 的思路是让模型一次预测多个 token，理论上能降低解码延迟，这个提速幅度如果属实，对长文本场景挺有吸引力。

但帖子正文被 Reddit 的安全策略挡了，我们看不到具体测试环境、硬件配置和任务类型。1.5 倍是在什么卡上跑的、跑的是代码生成还是闲聊、对比的基线版本是哪个，这些全都不清楚。没有这些，提速数字就只能当个方向性信号，不能直接拿来评估实际部署收益。另外，MTP 版本在长上下文下的输出质量有没有打折，正文也没披露。

想认真评估的话，还需要补上：硬件型号与显存、对比的具体版本号、任务类型和输出质量指标。如果后续有更完整的复现报告，这条线索才值得跟进。
