# 我重启了一台10年前的至强处理器174次，删掉12个启动参数，换来了每秒多跑4个token

> 原标题：I restarted a 10 year old Xeon 174 times to delete 12 flags and gain 4 tps

- 来源：Hacker News 首页
- 发布时间：2026-06-19T15:19:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39553
- 原文：https://point.free/blog/delete-12-flags/

## 摘要

作者把之前跑 Gemma 4 模型时用的那串25个启动参数，一个一个关掉做对比测试，看哪些真的有用。结果发现大部分参数都是摆设。真正影响速度的就三样：闪存注意力机制、物理核心线程数，以及按任务类型开关的投机解码。投机解码在写代码时能提速28%，但在总结长文档时反而拖慢54%，所以不能无脑开。另外，自动调参的草稿模型设置对长文本处理很不友好，关掉反而更快...

## 推荐理由

一篇给本地推理玩家看的硬核调参笔记，用174次重启的笨功夫换来了三个能直接落地的结论：大部分启动参数没用，投机解码要按任务开关，自动调参对长文本是坑。标题会勾人，内容有干货，但话题太窄，出了本地推理圈子就没声量了。

## 锐评

这篇文章的价值在于用最笨的办法做了最诚实的事：逐个关掉参数，看速度到底变不变。结论很打脸，那串看起来很厉害的25个参数里，大部分对性能没影响。真正起作用的杠杆只有三个：闪存注意力（关了速度直接腰斩）、物理核心线程数，以及投机解码。投机解码尤其有意思，它不是万能药。写代码时能提速28%，但处理长文档时反而拖慢54%，因为草稿模型猜错太多，验证开销比省下的时间还多。作者还发现自动调参的草稿模型设置对长文本很不友好，关掉反而更快。

不过要留个心眼。测试环境是一台2016年的老至强，没有GPU，内存是DDR3。这些结论在消费级显卡或苹果芯片上能不能复现，正文没提。另外，测试只用了Gemma 4这一个模型，换其他模型架构，这些参数的表现可能完全不同。作者自己也说了，参数之间有交互，单独关一个的效果不能简单相加。所以这篇的价值不是给你一份新的万能配置，而是告诉你：别信网上抄来的命令，自己跑一遍消融实验，哪怕只跑几个关键参数，也比全盘照搬强。
