# Semvec：把聊天记录压成固定大小的“语义状态”，上下文再长也不涨 token

> 原标题：I built &quot;Semvec&quot;: A Constant-Cost Semantic Memory for LLMs (Looking for testers!)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-02T13:44:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12967
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t1qbe5/i_built_semvec_a_constantcost_semantic_memory_for/

## 摘要

一个开发者在 Reddit 上发了个叫 Semvec 的项目，思路是把对话历史从无限增长的文本流换成固定大小的语义向量，每次推理只传这个压缩后的状态。他给出的 48 轮基准测试里，token 用量大概砍掉了 76%，而且第 10 轮和第 10000 轮的输入开销一样大。项目兼容 OpenAI 接口的模型，也接了 MCP、Claude Code、Curs...

## 推荐理由

这是个 Reddit 自发布项目，数据来自作者自己的基准，没有第三方验证，所以我会先打个折，不当成行业级事件。但它的思路挺省钱的：用固定大小的语义向量替代无限增长的对话历史，token 减少约 76%，而且第 10 轮和第 10000 轮输入量一样，对跑长链 agent 的人有参考价值。HKR 三项都满足，冲突、数字和治理/竞争伦理的神经都碰到了，只是目前没有裁决或产品级变动，所以保持在 featured 而不是更高优先级。

## 锐评

这个思路挺直接：把无限增长的聊天记录换成固定大小的语义压缩包，每次推理只传这个包，不再把整段历史塞进上下文窗口。开发者给出的数据是48轮基准测试里token用量减少约76%，而且第10轮和第10000轮的输入成本完全一样——这点如果属实，对跑长对话或agent场景确实省钱。

但得先打个折。Reddit原文被网络屏蔽了，我们拿到的只有摘要，看不到具体怎么做的语义压缩、用什么模型提取向量、压缩过程有没有信息损失、48轮测试的任务类型和评估标准是什么。这些关键信息全缺，没法判断76%这个数字在真实任务里能不能复现。

另外，固定大小的语义状态意味着模型只能看到压缩后的信息，遇到需要精确回忆对话细节的任务（比如记住用户三小时前说的一个具体数字），会不会丢信息？这点正文没披露。项目说兼容OpenAI接口、接了MCP和Claude Code，说明作者在往实用方向走，但没看到多agent共享状态的具体表现。建议等代码公开或有人复现后再判断。
