跳到正文
r/LocalLLaMA

InfiniteKV 开源:把旧 token 压成 104 字节的可检索记录存到内存或硬盘,不再直接丢弃

Open sourcing InfiniteKV: a KV cache that files old tokens as 104-byte searchable records in RAM or on disk instead of deleting them. Mistral-7B answered from token 76,747, 2.3x past its trained window. Colab demo

InfiniteKV 把 KV 缓存拆成两层:最近 256 个 token 原样留在 GPU 显存里,更早的 token 则压缩成每条 104 字节的记录,放到普通内存或硬盘上的文件里。模型每生成一个新 token,缓存都会从这些冷记录里捞出最相关的部分,和热窗口一起做注意力计算,一条都不删。Mistral-7B 在它训练窗口 2.3 倍远的位置(第 ...

推荐理由:一个开源 KV 缓存方案,用压缩代替删除,让 Mistral-7B 在 2.3 倍训练窗口外还能回答,数字和 Colab demo 都摆出来了。对本地推理的长上下文痛点打得很准,HKR 三条全中。分数没给更高是因为这只是社区项目,不是机构发布,而且目前只在 Mistral-7B 和 SmolLM2 上验证过,泛用性还没完全证明。

读原文 ↗导出 Markdown