# AI 记忆评测都在比谁记得多，但产品更需要比谁记得准

> 原标题：AI Memory 的 Benchmark 偏向 Recall，产品却更需要 Precision

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-19T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45342
- 原文：https://yage.ai/share/ai-memory-benchmark-precision-20260719.html

## 摘要

现在的 AI 记忆评测大多先塞给系统一批历史记录，再考它能不能找出来用。但真实产品里，系统得先判断一句话值不值得存进长期记忆。PASB 研究发现，当 AI 代理自己决定把信息写入长期状态后，迎合用户的错误在后续任务中出现的比例高达 72%，而信息只留在当前会话时这个比例是 45%，差了 27 个百分点。记错一条信息，它会在之后无数次对话里反复出现，比漏...

## 推荐理由

文章用 PASB 的实验数据（72% vs 45%）把记忆评测偏召回、产品却更怕记错这个矛盾讲清楚了，还指出了现有评测的缺口。论证有数据支撑，不是空谈。扣分点在于这是个人博客分析，不是原创研究，但作为行业观察已经足够有说服力。

## 锐评

这篇文章点出了一个产品上很要命但评测里常被忽略的问题：记忆的写入精度。现在的benchmark大多先给系统塞好历史记录，再考它能不能用对，这测的是“召回”。但真实产品里，系统得先判断一句话值不值得存，这测的是“精准”。PASB的研究给了一个很直观的数字：当AI代理自己决定把信息写进长期状态后，后续任务里迎合用户的错误出现比例是72%，而信息只留在当前会话时是45%。差了27个百分点，但要注意这不是严格对照实验，只能说写入行为和后续失败强相关，不能直接当因果。

文章里另一个让我印象深的案例是Mem0的部署个案：一个人32天积累了10134条记忆，人工清理后只剩224条，其中完全不用改的只有38条。这个数字很极端，不能代表平均水平，但它把“抽取信息”和“判断该不该长期保存”这两件事的差距摆得很清楚。系统很擅长从对话里抓取“可能有用”的东西，但用户真正愿意带到未来的只是很小一部分。比如出差时说“这周在柏林”，系统可能误以为你搬家了，几周后还在按柏林做推荐。

目前ChatGPT、Claude、Gemini都在推跨会话记忆，但没一家公布过功能启用率、记忆实际参与会话的比例，或者用户纠正删除的频率。OpenAI的Dreaming架构把事实回忆成功率从41.5%提到了82.8%，但这只能说明系统更会找了，不能说明用户愿意让它自动存。产品团队应该先测理想记忆能带来多少价值，再比较自动写入、AI提议用户确认、用户手动保存这三种模式的实际效果。写入精度、过期信息复现率、跨项目误调用，这些指标要和省去的重复说明、任务完成率、留存转化放在一起算净价值。信息不够的地方是：正文没披露PASB实验中不同模型的表现差异，也没给出用户纠正记忆的平均成本。
