模型说错话,七成以上不是没学过,而是没想起来
Empty shelves or lost keys? Recall is the bottleneck for parametric factuality
Google Research 把模型的事实性错误拆成两类:货架空着(训练时压根没学过)和钥匙丢了(学过但推理时调不出来)。他们用一套叫 SIR 的探测方法,拿训练数据去戳模型内部状态,看正确答案能不能被激活。测了 4 个模型、6 个数据集,结果发现至少 70% 的错误都属于“钥匙丢了”——知识在训练里见过,就是没提取出来。Gemini 2.5 Pro...
推荐理由:Google Research 把模型的事实性错误分成两类:训练时压根没学过的“空货架”,和学过但推理时调不出来的“丢钥匙”。他们用 SIR 方法测了 4 个模型、6 个数据集,发现至少 70% 的错误属于后者——知识在训练数据里见过,就是没提取出来。这个结论对做知识密集型应用的人很实用,但正文没披露不同规模模型的具体 breakdown,所以我会先打个折,不把重要性拉满。