# 在 13 年前的老至强 CPU 上跑 Gemma 4 26B 模型，每秒 5 个 token

> 原标题：Running Gemma 4 26B at 5 tokens/SEC on a 13-year-old Xeon with no GPU

- 来源：Hacker News 首页
- 发布时间：2026-07-15T15:34:05.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44528
- 原文：https://www.neomindlabs.com/2026/06/08/running-gemma-4-26b-at-5-tokens-sec-on-a-13-year-old-xeon-with-no-gpu/

## 摘要

作者把谷歌的 Gemma 4 26B 模型（一种混合专家模型，每次只激活部分参数）塞进了一台 2013 年的惠普存储服务器，双路至强 E5-2690 v2，没显卡，整机成本不到 300 美元。跑起来后生成速度约每秒 5.2 个 token，跟人阅读速度差不多。过程并不顺利：这 CPU 只支持 AVX1 指令集，而推理引擎 ik_llama.cpp 的优...

## 推荐理由

这是一篇第一人称的硬核实验，不是泛泛的“本地跑大模型”教程。Gemma 4 26B 这种混合专家模型塞进 2013 年老至强，没显卡，总花费不到 300 美元，每个细节都有实测数据撑着。HKR 三项全中，但本质是个人博客的折腾记录，不是产品发布或研究突破，所以重要性给 72、放 featured 刚好。

## 锐评

这事最值得看的地方不是“老机器跑新模型”，而是修bug的过程。作者用的CPU只支持AVX1，但推理引擎ik_llama.cpp的优化内核强制要求AVX2，导致模型输出乱码。Claude诊断出问题在于图构建器无条件生成了MOE_FUSED_UP_GATE操作，但调度器没有对应的处理分支，每次前向传播有约240个张量在读取未初始化的内存。修复后，生成速度达到每秒5.2个token，提示词处理约16个token。整机成本不到300美元。

不过正文没披露量化后模型占了多少内存，也没提功耗。这点先别太激动——5 tokens/秒的速度只适合后台批处理或API挂了当备胎，实时对话还是别想了。补丁已提交但还没合并，想试得从分支拉代码。
