在 13 年前的老至强 CPU 上跑 Gemma 4 26B 模型,每秒 5 个 token
Running Gemma 4 26B at 5 tokens/SEC on a 13-year-old Xeon with no GPU
作者把谷歌的 Gemma 4 26B 模型(一种混合专家模型,每次只激活部分参数)塞进了一台 2013 年的惠普存储服务器,双路至强 E5-2690 v2,没显卡,整机成本不到 300 美元。跑起来后生成速度约每秒 5.2 个 token,跟人阅读速度差不多。过程并不顺利:这 CPU 只支持 AVX1 指令集,而推理引擎 ik_llama.cpp 的优...
推荐理由:这是一篇第一人称的硬核实验,不是泛泛的“本地跑大模型”教程。Gemma 4 26B 这种混合专家模型塞进 2013 年老至强,没显卡,总花费不到 300 美元,每个细节都有实测数据撑着。HKR 三项全中,但本质是个人博客的折腾记录,不是产品发布或研究突破,所以重要性给 72、放 featured 刚好。