# 大模型还是不会算数、活在旧数据里，我们只是用外挂把坑填上了

> 原标题：LLMs Are Still Toxic, Stuck in the Past, and Bad at Math

- 来源：Hacker News 首页
- 发布时间：2026-07-24T12:51:13.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46361
- 原文：https://www.eyosias.dev/blog/llms-are-still-toxic-and-bad-at-math

## 摘要

作者拿 GPT Sol High 跑了 200 道加法，错了一道。模型不是在算，是在猜下一个数字长什么样。ChatGPT 能算对，是因为外面的程序把题目丢给了 Python 脚本。文章顺着这个思路拆了另外三个老毛病：知识停在训练截止日，靠外挂资料库（RAG）补；上下文窗口有限；模型骨子里还是有毒。真正的进步不在模型本身，而在包在它外面的那层工具。

## 推荐理由

这篇文章从一道加法错题切入，把大模型四个老毛病——算数靠猜、知识过时、记性短、骨子里有毒——挨个拆了一遍。作者没写公关稿，直接说进步来自外挂工具而不是模型本身，对天天用 AI 写代码的人是个清醒提醒。我会先打个折：正文没给毒性测试的具体样本，但实验部分和判断够实在，值得放在推荐位。

## 锐评

这篇文章用一道加法题把大模型的底裤扒了：35653046+16814852，GPT Sol High 算错了一位。作者跑了 200 道加法，错了一道，准确率看着高，但放到财务场景里，每几百笔就错一笔，根本没法用。模型不是在计算，是在模仿竖式，一个数字一个数字地猜最可能出现的 token，所以永远做不到百分百可靠。

ChatGPT 和 Claude 能算对，是因为外面的“马具”（harness）检测到数学题后，直接丢给 Python 脚本跑，模型只负责判断“这道题我该不该用工具”。文章顺着这个逻辑拆了另外三个老毛病：知识停在训练截止日、上下文窗口有限、模型骨子里还是有毒。这四个问题一个都没解决，只是被包在外面的工具层盖住了。

文章没给毒性测试的具体样本和上下文窗口的量化数据，只靠推特截图和作者自己的体验支撑，说服力打折。但核心判断站得住：过去几年的进步主要发生在模型外面的工程层，模型本身的硬伤还在原地。
