模型正在被故意变笨:用知识换推理,把事实赶出参数
Models Are Getting Dumber on Purpose
这篇文章观察到一个刻意的行业趋势:小模型在数学推理上越来越强,但记性越来越差。作者举了具体例子,Qwen3.5 9B 在知识测试里,遇到不会的问题有八成概率会瞎编一个答案;目前事实记忆最强的 Gemini 2.5 Pro,在不联网的测试里正确率也只有 53%。这不是 bug,而是实验室在用参数里的“世界知识”换“推理能力”。事实很占地方,而且会过时,比...
推荐理由:这篇文章观察到一个刻意为之的行业趋势,并用 Qwen 和 Gemini 的实测数据把“推理强了、记性差了”这个 tradeoff 讲得很具体。我会先打个折,因为它是一篇评论而非一手发布,没有多信源交叉验证,所以分数落在 78 分。但观点反常识、数据扎实、对做应用的人有直接提醒作用,够得上 featured。