# DeepMind 用 AI 挑战 700 道数学难题，结果有一题题干是错的，AI 还硬写了数十页证明

> 原标题：顶级AI撞上低级乌龙：连写几十页推导，结果发现题干错了？

- 来源：新智元 · 公众号
- 发布时间：2026-05-04T04:04:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/13734
- 原文：https://mp.weixin.qq.com/s?__biz=MzI3MTA0MTk1MA==&mid=2652697629&idx=3&sn=5404251f2e631c9e6b6c3da609033ed5

## 摘要

Google DeepMind 搞了个叫 Aletheia 的流程，拿 Gemini Deep Think 去啃 700 道 Erdős 数学猜想。流程是先让模型生成 200 个候选答案，再用验证器筛到 63 个，最后产出 13 个原创解答。乌龙出在 Erdős-75 这道题上：题干本身就有问题，但 Aletheia 没发现，照样洋洋洒洒推导了几十页。...

## 推荐理由

我会先打个折：文章本身是媒体转述，原始论文细节得去看 arXiv，正文没披露验证器的具体设计和人类专家的复核标准。但选题确实抓人——一个题干有误的 Erdős-75 问题，AI 照样输出几十页证明，这比单纯报 benchmark 分数更能让人停下来想一下推理可靠性。700 个问题、13 个原创答案、200 到 63 的筛选管线，这些数字把流程讲清楚了，不是空泛的“AI 做数学”。对从业者来说，验证器能筛掉什么、筛不掉什么，才是真正关心的，文章至少把这个问题摆到了台面上。

## 锐评

Google DeepMind 用 Aletheia 流程让 Gemini Deep Think 去解 700 道 Erdős 数学猜想，先海选 200 个候选答案，再筛到 63 个，最后产出 13 个原创解答。结果在 Erdős-75 这道题上翻了车——题干本身就有问题，但模型没发现，照样洋洋洒洒推导了几十页。

这事比单纯答错严重。它说明模型在“给定前提”下推理能力很强，但缺乏跳出框框审视题目本身的能力。就像一个考试机器，你给什么题它就做什么，从不反问“老师，这题是不是出错了”。

正文没披露那 13 个原创解答是否经过人工验证，也没说 Erdős-75 的错误前提是故意埋的还是意外发现的。如果连题干错误都检不出来，那其他 12 个解答的可信度也得打个问号。陶哲轩之前提过用 AI 辅助数学研究，但前提是 AI 得先学会说“这不对”。
