跳到正文
r/LocalLLaMA

Semvec:把聊天记录压成固定大小的“语义状态”,上下文再长也不涨 token

I built "Semvec": A Constant-Cost Semantic Memory for LLMs (Looking for testers!)

一个开发者在 Reddit 上发了个叫 Semvec 的项目,思路是把对话历史从无限增长的文本流换成固定大小的语义向量,每次推理只传这个压缩后的状态。他给出的 48 轮基准测试里,token 用量大概砍掉了 76%,而且第 10 轮和第 10000 轮的输入开销一样大。项目兼容 OpenAI 接口的模型,也接了 MCP、Claude Code、Curs...

推荐理由:这是个 Reddit 自发布项目,数据来自作者自己的基准,没有第三方验证,所以我会先打个折,不当成行业级事件。但它的思路挺省钱的:用固定大小的语义向量替代无限增长的对话历史,token 减少约 76%,而且第 10 轮和第 10000 轮输入量一样,对跑长链 agent 的人有参考价值。HKR 三项都满足,冲突、数字和治理/竞争伦理的神经都碰到了,只是目前没有裁决或产品级变动,所以保持在 featured 而不是更高优先级。

读原文 ↗导出 Markdown