# PFlash：在 RTX 3090 上跑 128K 上下文，预填充比 llama.cpp 快 10 倍

> 原标题：PFlash: 10x prefill speedup over llama.cpp at 128K on a RTX 3090

- 来源：r/LocalLLaMA
- 发布时间：2026-05-01T14:53:57.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12769
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t0vp3w/pflash_10x_prefill_speedup_over_llamacpp_at_128k/

## 摘要

PFlash 让 Qwen3.6-27B 的 Q4_K_M 量化模型在单张 RTX 3090 上处理 12.8 万 token 的输入时，首 token 延迟从 llama.cpp 冷启动的 248.4 秒压到 24.8 秒。做法是用一个 Qwen3-0.6B 小模型当“打分员”，挑出最重要的 5% 文本片段喂给大模型，省掉了大量无关计算。整个方案用 ...

## 推荐理由

HKR 三项都踩中了，但这是单条 Reddit 帖子，质量验证只给了单针 NIAH 32K–128K 全通过，RULER 和多针结果没放出来，所以先放在 featured 门槛上。

## 锐评

这条值得看，因为它解决了一个很实际的痛点：用消费级显卡跑长上下文模型，等首字等到睡着。PFlash 的做法是让一个 0.6B 的小模型先快速读一遍全文，给每个片段打分，只把最重要的 5% 喂给大模型，相当于请了个实习生帮你划重点。结果很直观，llama.cpp 冷启动要 248 秒，它只要 24.8 秒，快了十倍。

但兴奋之前得先打个折。作者自己说了，目前只在单针大海捞针任务上验证过，从 32K 到 128K 都能找到。多针检索和 RULER 这类更复杂的测试结果没放出来，正文也没提。这意味着我们还不知道它在真实场景里会不会漏掉关键信息，毕竟只留 5% 的文本，万一扔掉了重要的上下文，回答质量会直接崩。

另外，方案是用 C++/CUDA 写的，不依赖 Python 和 PyTorch，这对想集成到现有推理框架的人来说是个好消息。但没看到跟其他加速方案比如 vLLM 的对比，也没说小模型打分本身要花多少时间，这些信息缺口让 10 倍这个数字得先打个问号。
