# 一台 5 年老笔记本跑通 35B 模型：6GB 显存 + CPU 混合推理，插电 23 token/秒

> 原标题：Pushing a 5-Year-Old 6GB VRAM laptop to Its Limits: Qwen3.6-35B-A3B

- 来源：r/LocalLLaMA
- 发布时间：2026-05-03T22:16:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13182
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t2zapy/pushing_a_5yearold_6gb_vram_laptop_to_its_limits/

## 摘要

Reddit 用户 abhinand05 在一台 5 年前的华硕 ROG Zephyrus G14 上跑起了 Qwen3.6-35B-A3B 模型。这台笔记本只有 RTX 2060 Max-Q 6GB 显存，搭配 24GB DDR4 内存和 Ryzen 7 处理器。插电时生成速度约 23 token/秒，不插电掉到 10 token/秒出头。能跑起来的...

## 推荐理由

我会先打个折：这只是单个Reddit用户的跑分，不是官方发布，别当基准看。但它的价值不在权威性，而在把CPU MoE、KV cache量化和ngram推测解码这三样东西组合起来，在6GB显存的旧机器上跑出可用的速度。正文没披露量化精度和功耗细节，这点先别太激动。对想用老设备玩大模型的从业者来说，这篇给了参数和思路，比单纯喊'能跑'有用得多。

## 锐评

这条帖子最值得看的是配置思路，不是跑分。用户在一台RTX 2060 Max-Q 6GB显存的旧笔记本上跑Qwen3.6-35B-A3B，插电时生成速度约23 token/秒，不插电掉到10 token/秒出头。能跑起来靠三招：把MoE的部分层扔给CPU算，对KV缓存做量化压缩，再加ngram投机解码来加速。这相当于用CPU的算力换显存空间，同时用预测下一个词的方式减少等待时间。

不过帖子正文被Reddit的403拦截了，具体llama-server参数、模型量化格式、上下文长度拉到64k和128k时的实际延迟和显存占用都没披露。23 token/秒是短文本还是长对话也不清楚，长上下文下KV缓存膨胀后速度可能掉得很厉害。另外CPU分担MoE层对Ryzen 7的负载、风扇噪音、续航影响也没提。

这条对显存紧张的用户有参考价值，但缺实测细节，别直接照搬配置。想复现的话，得自己测不同量化级别和投机解码参数的实际效果。
