# 一台 300 美元笔记本跑 Qwen 3.5 35B 模型，推理速度跑到每秒 10.33 个 token

> 原标题：Inferencing at 10.33 t/s on Qwen 3.5 35B on a $300 laptop

- 来源：r/LocalLLaMA
- 发布时间：2026-05-27T19:26:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/28791
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tpfw50/inferencing_at_1033_ts_on_qwen_35_35b_on_a_300/

## 摘要

一位 Reddit 用户在一台 300 美元买的联想 Ideapad Slim 3i 上，用纯 CPU 跑 Qwen 3.5 35B 模型（Q4_K_S 量化版），推理速度达到了每秒 10.33 个 token。这台机器是 i3-1215U 处理器，板载 8GB 内存加一条 32GB DDR4 扩展内存。能跑出这个速度，主要靠几个操作：用 ik_lla...

## 推荐理由

我会先打个折：这是 Reddit 单帖，不是系统评测，复现性存疑。但信息本身很实在——一台 300 美元的联想轻薄本，用双核 CPU 跑 35B 参数的模型，推理速度能到每秒 10 个 token 出头。这个数字说明，如果场景对延迟要求不高，极低成本硬件也能把大模型跑起来。正文没披露上下文长度和内存占用，这点先别太激动。

## 锐评

这条帖子的亮点是成本控制：一台300美元的联想笔记本，纯CPU推理，把Qwen 3.5 35B模型跑到了每秒10.33个token。但先别激动，这个35B是MoE（混合专家）架构，实际干活时只激活大约3B参数，所以本质上是在跑一个小得多的模型，速度自然快。作者自己也说了，换成Gemma 4 26B（激活参数多25%），速度就掉到3 t/s左右。

优化手段挺实在：用ik_llama.cpp这个推理引擎，把任务钉在两个性能核上，开了MTP投机解码（一次猜多个token），KV缓存也做了Q8_0量化。温度飙到90度但没降频，作者猜测ik_llama的CPU效率比原版llama.cpp好，不过没做严格对照，这点存疑。

正文没披露输出质量有没有因为投机解码或量化打折，也没测长上下文下的速度衰减。另外，内存是8GB板载加32GB扩展的非对称双通道，对带宽的影响也没量化。如果未来真能通过刷BIOS调内存时序和换DDR5再提20%速度，那这台机器的性价比确实能打，但目前还缺可复现的验证。
