# 模型正在被故意变笨：用知识换推理，把事实赶出参数

> 原标题：Models Are Getting Dumber on Purpose

- 来源：Hacker News 首页
- 发布时间：2026-08-16T19:04:26.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/51048
- 原文：https://w4g1.dev/blog/models-are-getting-dumber-on-purpose

## 摘要

这篇文章观察到一个刻意的行业趋势：小模型在数学推理上越来越强，但记性越来越差。作者举了具体例子，Qwen3.5 9B 在知识测试里，遇到不会的问题有八成概率会瞎编一个答案；目前事实记忆最强的 Gemini 2.5 Pro，在不联网的测试里正确率也只有 53%。这不是 bug，而是实验室在用参数里的“世界知识”换“推理能力”。事实很占地方，而且会过时，比...

## 推荐理由

这篇文章观察到一个刻意为之的行业趋势，并用 Qwen 和 Gemini 的实测数据把“推理强了、记性差了”这个 tradeoff 讲得很具体。我会先打个折，因为它是一篇评论而非一手发布，没有多信源交叉验证，所以分数落在 78 分。但观点反常识、数据扎实、对做应用的人有直接提醒作用，够得上 featured。

## 锐评

这篇文章点出了一个很反直觉的行业趋势：模型正在被故意做“笨”。这里的“笨”不是指推理能力下降，而是指事实记忆能力暴跌。作者举了很具体的数字，Qwen3.5 9B 在知识测试里，遇到不会的问题有八成多概率会瞎编一个答案；目前事实记忆最强的 Gemini 2.5 Pro，在不联网的测试里正确率也只有 53%。

为什么会这样？因为事实很占参数空间，而且会过时。一个模型记住某个 npm 包的函数参数顺序，成本很高，但包一更新，这些记忆就废了。相比之下，推理是一套可以反复使用的解题步骤，压缩效率高，还不容易过期。所以实验室现在主动做减法，把参数留给推理，把查事实的活儿交给外挂资料库和联网搜索。

这个判断如果成立，影响挺大。以后跑在单张消费级显卡上的前沿推理模型，可能是个“常识广但深度浅”的通才，遇到具体问题会老实说“不知道”然后去查。这或许真能解决瞎编问题，但前提是外挂资料库得足够靠谱。文章没讨论的是，如果模型连问题领域都识别错了，它该去查什么？这点还需要更多验证。
