# 一台笔记本跑通 Qwen3.6 35B-A3B：我的本地模型“从零到一”时刻

> 原标题：Qwen3.6 35B-A3B on a Laptop: My Zero to One Moment

- 来源：r/LocalLLaMA
- 发布时间：2026-06-07T15:13:30.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35040
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tzernu/qwen36_35ba3b_on_a_laptop_my_zero_to_one_moment/

## 摘要

一位 Reddit 用户分享了自己在笔记本上跑通 Qwen3.6 35B-A3B 的体验。他的机器是华硕 Zenbook Pro 14，配了 RTX 4060 8GB 显存和 64GB 内存。用 llama.cpp 加载 unsloth 的 IQ3_XXS 量化版模型，在 3.2 万 token 上下文时生成速度约 27 token/秒，拉到 25.6...

## 推荐理由

这是单个用户的 Reddit 实测，不是官方发布或论文，但硬件、量化方式、上下文长度和速度都给得很具体，对想在自己机器上跑大模型的人有直接参考价值。我会先打个折，因为只有一台机器的数据，不代表普遍表现，但信息密度够上 featured，分数放在 72–77 这个区间合理。

## 锐评

这条分享的价值在于给出了一个很具体的消费级笔记本跑大模型的参照点。华硕 Zenbook Pro 14 配 RTX 4060（8GB 显存）和 64GB 内存，用 llama.cpp 加载 unsloth 的 IQ3_XXS 量化版 Qwen3.6 35B-A3B，在 3.2 万 token 上下文时跑到约 27 token/秒，拉到 25.6 万 token 上下文时降到约 18 token/秒。这个速度对于个人助手、读文件、跑命令行这类场景确实能用了，也解释了作者为什么觉得“本地第二大脑”终于成立——他不想把私人想法交给云端模型。

不过得打个折。作者自己也列了问题：模型偶尔会陷入循环、有时不读完技能说明就偷懒做决定，而且输出很不稳定。这些毛病很可能跟 IQ3_XXS 这种极低量化有关，但正文没做对比测试，没法判断是量化损失还是模型本身的问题。另外，他通过端到端加密的 Matrix 桥接把模型连到手机上，这意味着笔记本得一直开着，体验上打了折扣。

还缺什么？没提首 token 延迟，这对交互体感影响很大；也没说跑工具调用（比如写文件、执行 git 命令）时的成功率和失败模式。如果真想把它当“第二大脑”用，这些可靠性指标比纯生成速度更重要。
