# InfiniteKV 开源：把旧 token 压成 104 字节的可检索记录存到内存或硬盘，不再直接丢弃

> 原标题：Open sourcing InfiniteKV: a KV cache that files old tokens as 104-byte searchable records in RAM or on disk instead of deleting them. Mistral-7B answered from token 76,747, 2.3x past its trained window. Colab demo

- 来源：r/LocalLLaMA
- 发布时间：2026-06-12T06:34:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/37822
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u3nicr/open_sourcing_infinitekv_a_kv_cache_that_files/

## 摘要

InfiniteKV 把 KV 缓存拆成两层：最近 256 个 token 原样留在 GPU 显存里，更早的 token 则压缩成每条 104 字节的记录，放到普通内存或硬盘上的文件里。模型每生成一个新 token，缓存都会从这些冷记录里捞出最相关的部分，和热窗口一起做注意力计算，一条都不删。Mistral-7B 在它训练窗口 2.3 倍远的位置（第 ...

## 推荐理由

一个开源 KV 缓存方案，用压缩代替删除，让 Mistral-7B 在 2.3 倍训练窗口外还能回答，数字和 Colab demo 都摆出来了。对本地推理的长上下文痛点打得很准，HKR 三条全中。分数没给更高是因为这只是社区项目，不是机构发布，而且目前只在 Mistral-7B 和 SmolLM2 上验证过，泛用性还没完全证明。

## 锐评

InfiniteKV 的思路很直接：不删 KV 缓存，而是把老 token 压成每条 104 字节的记录，扔到内存或硬盘文件里，生成时再捞回来一起算注意力。Mistral-7B 在训练窗口 2.3 倍远的位置（第 76,747 个 token）还能答对藏起来的密钥，说明这种“冷热分层”确实能拉长有效上下文。到一百万 token 时，冷存储大约占 3 GB，而 float16 全量缓存要 122 GB，省了 40 倍空间。作者在 16 GB 显存的 RTX 3080 笔记本上测了七个模型，top-1 一致率约 0.95，KL 散度中位数约 0.002，跟原版模型偏差很小。

不过这些数字得打个折。参考实现是纯 PyTorch，速度慢，作者自己也说“别指望实时跑”。目前不支持滑动窗口和 MLA 架构的模型，能测的范围有限。另外，正文没披露检索冷记录的延迟到底多大，也没给长文本下的困惑度或下游任务分数，只靠 passkey 和一致性指标还不够判断实际可用性。如果后续能补上延迟数据和更多模型的支持，这个方案在本地跑长文档的场景里会挺有吸引力。
