# Google 发现让模型先想一会儿，能把它训练时记住但平时想不起来的知识挖出来

> 原标题：Thinking to recall: How reasoning unlocks parametric knowledge in LLMs

- 来源：Google 研究院
- 发布时间：2026-06-24T16:51:52.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/41185
- 原文：https://research.google/blog/thinking-to-recall-how-reasoning-unlocks-parametric-knowledge-in-llms/

## 摘要

这篇博客讲的是推理如何帮大模型从自己的参数里“回忆”事实。他们拿 Gemini 2.5 Pro 在 Natural Questions 上测，不给推理机会时准确率大概 40%，让它先思考再回答，准确率直接跳到 70% 以上。提升不是靠外挂资料库，而是模型在推理过程中把模糊的记忆碎片串成可验证的链条，推理步骤里经常出现自我提问和事实核查。目前只在问答任务...

## 推荐理由

Google Research 这篇机制研究有实打实的数字，讲清了推理怎么帮模型从参数里挖事实，40% 到 70% 的跳升很直观。但只在 Natural Questions 上测了，正文没提其他任务或模型的表现，所以分数先打到这里。对做 RAG 和评估的人是个参考，别急着当通用结论。

## 锐评

Google Research 拿 Gemini 2.5 Pro 在 Natural Questions 上做了个实验：不让模型推理时，它从自己参数里回忆事实的准确率只有大约 40%；允许它先思考再回答，准确率直接拉到 70% 以上。这个提升不是靠外挂资料库，而是模型在推理过程中自己把模糊的记忆碎片串成了可验证的链条，推理步骤里经常出现自我提问和事实核查。

这个结果挺直观——给模型时间“想”，它确实能想起更多训练时见过的东西。但正文只披露了问答任务的表现，没提其他任务类型、没给延迟数据，也没说推理过程多花了多少算力。70% 的准确率放在生产环境还是不够稳，而且 Natural Questions 本身偏事实型短答案，换成长文本生成或需要多步推理的任务，这个涨幅能不能复现要打个问号。

另外，文章没对比同等算力下直接让模型多输出几轮猜测的效果，也没说推理链里那些自我核查步骤是模型真在“检查”，还是只是生成了一串看起来像检查的文字。这点先别太激动，等有更多任务和模型的对照数据再说。
