# 模型说错话，七成以上不是没学过，而是没想起来

> 原标题：Empty shelves or lost keys? Recall is the bottleneck for parametric factuality

- 来源：Google 研究院
- 发布时间：2026-08-12T09:51:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51129
- 原文：https://research.google/blog/empty-shelves-or-lost-keys-recall-is-the-bottleneck-for-parametric-factuality/

## 摘要

Google Research 把模型的事实性错误拆成两类：货架空着（训练时压根没学过）和钥匙丢了（学过但推理时调不出来）。他们用一套叫 SIR 的探测方法，拿训练数据去戳模型内部状态，看正确答案能不能被激活。测了 4 个模型、6 个数据集，结果发现至少 70% 的错误都属于“钥匙丢了”——知识在训练里见过，就是没提取出来。Gemini 2.5 Pro...

## 推荐理由

Google Research 把模型的事实性错误分成两类：训练时压根没学过的“空货架”，和学过但推理时调不出来的“丢钥匙”。他们用 SIR 方法测了 4 个模型、6 个数据集，发现至少 70% 的错误属于后者——知识在训练数据里见过，就是没提取出来。这个结论对做知识密集型应用的人很实用，但正文没披露不同规模模型的具体 breakdown，所以我会先打个折，不把重要性拉满。

## 锐评

这篇研究把模型胡说八道的原因拆得很清楚：要么是训练数据里压根没有（货架空），要么是学过但推理时调不出来（钥匙丢了）。他们用一套叫 SIR 的方法去戳模型的内部状态，发现至少 70% 的错误都属于后者。到了 Gemini 2.5 Pro 这个级别，比例更是冲到 90% 以上。这个数字很关键，它直接挑战了“数据越多模型越准”的惯性思维——如果知识已经在里面了，只是拿不出来，那继续堆数据就是浪费算力。

不过，这个结论的适用范围得打个折。研究覆盖了 4 个模型和 6 个数据集，但 SIR 方法本身依赖训练数据去探测，如果训练数据本身有错或者覆盖不全，可能会漏判一些“货架空”的情况。另外，正文没披露 SIR 探测本身的计算成本有多高，如果比直接加外挂资料库还贵，那工程上就不太划算。

还缺一个关键信息：他们只说了问题出在“提取”环节，但没给出具体怎么修。是改推理时的采样策略，还是训练阶段加一个偏好优化目标？如果能补上解决方案的对比实验，这篇的实用价值会更高。
