# 在笔记本 RTX 4060 8GB 上跑 Qwen3.6-35B-A3B 的实测：一个参数改动让速度从 11 跳到 43 tok/s，投机解码再提 26%

> 原标题：Running Qwen3.6-35B-A3B on a laptop RTX 4060 (8GB) — what worked, what didn't, and a surprising speculative-decoding result

- 来源：r/LocalLLaMA
- 发布时间：2026-06-05T20:25:43.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34689
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1txwff3/running_qwen3635ba3b_on_a_laptop_rtx_4060_8gb/

## 摘要

一位 Reddit 用户在自己的笔记本（RTX 4060 8GB 显存）上跑了 Qwen3.6-35B-A3B 这个混合专家模型。他试下来发现，加上 --no-mmap 这个启动参数后，生成速度直接从大约 11 tok/s 飙到 43 tok/s，翻了近四倍。另外他还用了一个叫投机解码的技巧，拿更小的 Qwen3.5-0.8B 当“草稿模型”先快速出初...

## 推荐理由

HKR 三项都站得住：笔记本跑 35B 模型是个很直观的 hook，速度提升的数字是硬干货，而且本地部署圈对这类省钱省显存的技巧天然有共鸣。信息来源是 Reddit 单帖，不是正式评测，所以分数没往上拉。

## 锐评

这条帖子本身挺有意思：一台 RTX 4060 8GB 显存的笔记本，跑 Qwen3.6-35B-A3B 这种混合专家模型，通过加 --no-mmap 参数把生成速度从约 11 tok/s 拉到 43 tok/s，翻了近四倍。还试了投机解码，用 Qwen3.5-0.8B 当草稿模型先快速出初稿，吞吐量再提升 26%。这两个数字说明在消费级硬件上跑大模型的门槛确实在降，尤其是混合专家模型只激活部分参数，对显存友好。

但问题在于，Reddit 原文被屏蔽了，我们拿到的只有摘要。--no-mmap 为什么能带来这么大提升、是在什么后端跑的、量化精度是多少、上下文长度设了多少、投机解码的接受率如何，这些关键信息正文都没披露。没有这些，43 tok/s 这个数字就只能当个参考，不能直接复现。

我会先给这个结果打个折：速度提升的方向是对的，但具体能到什么程度，得看你的模型加载方式、驱动版本和 prompt 长度。如果你也想在笔记本上试，建议先确认自己的显存余量，再对比一下开不开 mmap 的差异，别直接照搬别人的参数。
