一台 300 美元笔记本跑 Qwen 3.5 35B 模型,推理速度跑到每秒 10.33 个 token
Inferencing at 10.33 t/s on Qwen 3.5 35B on a $300 laptop
一位 Reddit 用户在一台 300 美元买的联想 Ideapad Slim 3i 上,用纯 CPU 跑 Qwen 3.5 35B 模型(Q4_K_S 量化版),推理速度达到了每秒 10.33 个 token。这台机器是 i3-1215U 处理器,板载 8GB 内存加一条 32GB DDR4 扩展内存。能跑出这个速度,主要靠几个操作:用 ik_lla...
推荐理由:我会先打个折:这是 Reddit 单帖,不是系统评测,复现性存疑。但信息本身很实在——一台 300 美元的联想轻薄本,用双核 CPU 跑 35B 参数的模型,推理速度能到每秒 10 个 token 出头。这个数字说明,如果场景对延迟要求不高,极低成本硬件也能把大模型跑起来。正文没披露上下文长度和内存占用,这点先别太激动。