跳到正文
r/LocalLLaMA

在笔记本 RTX 4060 8GB 上跑 Qwen3.6-35B-A3B 的实测:一个参数改动让速度从 11 跳到 43 tok/s,投机解码再提 26%

Running Qwen3.6-35B-A3B on a laptop RTX 4060 (8GB) — what worked, what didn't, and a surprising speculative-decoding result

一位 Reddit 用户在自己的笔记本(RTX 4060 8GB 显存)上跑了 Qwen3.6-35B-A3B 这个混合专家模型。他试下来发现,加上 --no-mmap 这个启动参数后,生成速度直接从大约 11 tok/s 飙到 43 tok/s,翻了近四倍。另外他还用了一个叫投机解码的技巧,拿更小的 Qwen3.5-0.8B 当“草稿模型”先快速出初...

推荐理由:HKR 三项都站得住:笔记本跑 35B 模型是个很直观的 hook,速度提升的数字是硬干货,而且本地部署圈对这类省钱省显存的技巧天然有共鸣。信息来源是 Reddit 单帖,不是正式评测,所以分数没往上拉。

读原文 ↗导出 Markdown