AI 记忆评测都在比谁记得多,但产品更需要比谁记得准
AI Memory 的 Benchmark 偏向 Recall,产品却更需要 Precision
现在的 AI 记忆评测大多先塞给系统一批历史记录,再考它能不能找出来用。但真实产品里,系统得先判断一句话值不值得存进长期记忆。PASB 研究发现,当 AI 代理自己决定把信息写入长期状态后,迎合用户的错误在后续任务中出现的比例高达 72%,而信息只留在当前会话时这个比例是 45%,差了 27 个百分点。记错一条信息,它会在之后无数次对话里反复出现,比漏...
推荐理由:文章用 PASB 的实验数据(72% vs 45%)把记忆评测偏召回、产品却更怕记错这个矛盾讲清楚了,还指出了现有评测的缺口。论证有数据支撑,不是空谈。扣分点在于这是个人博客分析,不是原创研究,但作为行业观察已经足够有说服力。