# Milla Jovovich 和开发者发布开源记忆系统 MemPalace，声称 LongMemEval 满分，但被指只测了检索、没测端到端问答

> 原标题：好莱坞女星 Milla Jovovich（《第五元素》女主角）和开发者 Ben Sigman 联合发布了一个开源 AI 记忆系统 MemPalace，声称在 LongMemEval…

- 来源：X · @dotey（宝玉）
- 发布时间：2026-04-07T15:46:19.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3611
- 原文：https://x.com/dotey/status/2041543098451259772

## 摘要

MemPalace 想解决 AI 对话一结束就失忆的问题：不靠 AI 自己挑重点，而是把全部对话按“宫殿—翼—房间—走廊”的结构存下来，全部本地运行，不依赖云服务。它配套了一个叫 AAAK 的压缩语法，号称能把上下文压到 30 倍，但实测压缩后检索准确率从 96.6% 掉到 84.2%，差了 12 个百分点，无损压缩不会这样。项目宣称的 LongMem...

## 推荐理由

我会先打个折，满分这事别太激动。项目亮点是全本地运行、不用云服务，AAAK 压缩语法号称能把上下文压到原来的三十分之一，MCP 接入后能调 19 个工具翻历史记录。但 Penfield Labs 直接指出这个满分只测了检索，不是端到端问答，而且用上 AAAK 后检索准确率反而从 96.6% 跌到 84.2%，说明压缩是有代价的。正文没披露模型规模、硬件要求和实际延迟，这些缺口让实用性还不好判断。明星光环和开源旗号能带来关注，但技术验证还得看后续实测。

## 锐评

MemPalace 想解决一个真实痛点：AI 聊完就忘，现有记忆方案又只记标签不记原文。它反其道行之，把全部对话按“宫殿—翼—房间—走廊”的结构存下来，全部本地跑，不碰云。这个思路本身不差，仅靠结构分层检索就让准确率提升了 34%，纯本地基线 96.6% R@5 也是同类里最高的。

问题出在宣传上。LongMemEval 的“满分”只做了检索这一步，没生成答案也没经过评判，标准排行榜比的是端到端问答准确率，难度差了一个量级。LoCoMo 的 100% 更离谱，检索参数设成 top_k=50，等于把所有内容全丢给模型做阅读理解，检索层被绕过了，项目自己的文档也承认了这一点。AAAK 压缩号称 30 倍无损，实测检索准确率从 96.6% 掉到 84.2%，差了 12 个百分点，无损压缩不该这样。

项目内部文档其实比较老实，大部分缺陷在 BENCHMARKS.md 里都写了。但发布推文把所有限定条件去掉，只留最炸裂的数字。现在还缺的是：压缩算法到底牺牲了什么信息、矛盾检测功能为什么代码里找不到、以及脱离特定测试集后真实场景的表现。
