# 模型答错事实题，先分清是没存进去，还是这次没取出来

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-30T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53811
- 原文：https://yage.ai/share/wikiprofile-recall-bottleneck-20260830.html

## 摘要

Google Research 在 ICML 2026 发了一篇论文，用 2150 条维基百科事实测了 13 个模型，想搞清楚模型答错题到底是因为压根没学过，还是学过但这次没想起来。他们设计了两把尺子：一把松的，让模型接着维基百科原文往下写，测它有没有存进去，前沿模型能拿到 95–98% 的编码率；一把严的，闭卷、换着说法正问反问，四道题全对才算过，结...

## 推荐理由

这篇论文把模型的事实错误拆成存储失败和检索失败，诊断思路清晰，数据也扎实，对做模型评估和系统优化的人有直接参考价值。但测试只用了维基百科一个来源，而且是 Google 自家论文，结论能不能泛化到其他知识类型还得打个问号，所以重要性给到 78，放在 featured 里。

## 锐评

这篇论文最值得看的地方，是把“没存进去”和“存了没取出来”这两种失败干净地分开了。作者用贴着原文往下接的方式测存储，前沿模型能拿到95–98%的编码率，说明货架基本是满的。但一换成闭卷、换着说法正问反问，失败率立刻跳到26–34%。这个缺口的大小有尺子松紧的人为因素，但缺口的形状是硬的：冷门事实和热门事实存进去的差距只有5个点，取出来的差距却拉到20个点以上，说明瓶颈卡在提取通路，不是语料覆盖。

另一个反直觉的发现是思考的作用。面对毫无推理链路的单跳事实，开启思考能救回40–65%已编码但没取出的答案，而对根本没存进去的事实只能救回5–15%。这说明思考在这里不是逻辑推演，更像在权重里翻找记忆。对做系统的人来说，这直接给出了成本账本：思考是药，但只对存进去的内容有效，盲目全量开启就是浪费算力。

论文的局限也得说清楚。测试只用了2150条维基百科事实，全是公开的单跳知识，结论能不能迁移到多跳推理或私有数据上，正文没给出验证。另外，模型能不能自己判断“这次能不能取出来”，也就是元认知能力，论文也没答案，而这恰恰是线上精准触发思考或检索的关键。
