# Reddit 网友用英特尔傲腾持久内存攒了一台机器，本地跑 1 万亿参数模型，速度超过 4 token/秒

> 原标题：Computer build using Intel Optane Persistent Memory - Can run 1 trillion parameter model at over 4 tokens/sec

- 来源：r/LocalLLaMA
- 发布时间：2026-05-11T19:54:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17658
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1taeg8h/computer_build_using_intel_optane_persistent/

## 摘要

Reddit 用户 APFrisco 分享了一套硬件方案：用 768GB 英特尔傲腾持久内存（Optane PMem）当主存储，搭配 192GB DDR4 ECC 内存和一张 12GB 显存的 RTX 3060 显卡，通过 llama.cpp 的混合推理（CPU+GPU），在本地跑起了 Kimi K2.5 这个 1 万亿参数模型的 Q2_K_XL 量化...

## 推荐理由

HKR 三项都成立：标题的反差感足够抓人，正文把硬件型号、量化版本和速度都列清楚了，而且对本地推理圈子的成本敏感用户有直接参考价值。不过这只是单个 Reddit 用户的分享，复现细节和稳定性都没展开说，所以分数就压在 featured 门槛上。

## 锐评

Reddit 用户 APFrisco 用 768GB 英特尔傲腾持久内存加 192GB DDR4 内存和一张 RTX 3060，在本地跑起了 Kimi K2.5 的 1 万亿参数量化版，速度约每秒 4 个 token。这个方案的核心是把傲腾当主存储，靠 llama.cpp 混合 CPU 和 GPU 推理，绕开了显存不够的硬伤。每秒 4 个 token 的速度不算快，大概相当于人眼扫读，但考虑到模型体量和硬件门槛，已经能让个人用户“跑得动”了。

不过原文被 Reddit 屏蔽，我们看不到完整的配置细节、功耗数据或长时间运行的稳定性。傲腾持久内存虽然单 GB 成本比显存低很多，但二手市场价格波动大，实际攒机成本不好估算。另外，Q2_K_XL 这种极低量化对模型回答质量的影响有多大，正文也没提。这点先别太激动，等有实测对比再下结论。
