# 谷歌搞了个“AI 联合数学家”，用多智能体协作刷了最难数学基准的新纪录

> 原标题：谷歌「AI联合数学家」来了！刷新最难数学AI基准SOTA，牛津教授用它解开群论悬案

- 来源：量子位 · 公众号
- 发布时间：2026-05-09T03:18:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/16711
- 原文：https://mp.weixin.qq.com/s?__biz=MzIzNjc1NzUzMw==&mid=2247889444&idx=2&sn=68b16a5a852c21402ce32f8306dcceba

## 摘要

谷歌 DeepMind 发布了一个叫 AI Co-Mathematician 的系统，它不是单个模型，而是一套异步协作的智能体工作区，专门用来做数学研究。在 FrontierMath 这个目前最难的数学基准测试里，它解开了 48 道 Tier 4 级私密题中的 23 道，正确率 48%。对比之下，GPT-5.5 Pro 的正确率是 39.6%。测试条件...

## 推荐理由

我会先打个折：正文没披露模型架构、训练数据和具体成本，所以没法判断这 48% 的含金量到底多实。但故事本身很抓人——牛津教授用这个系统解开了一个群论悬案，同时 FrontierMath Tier 4 这种非公开难题集上的成绩比 GPT-5.5 Pro 高了 8 个多点，说明在极难数学推理上确实往前走了一步。对做推理和 agent 的人来说，这是个值得盯的信号，但别急着把它当成通用数学家的雏形。

## 锐评

谷歌DeepMind这次发布的AI Co-Mathematician，不是单个模型，而是一套让多个AI智能体异步协作的工作区，专门啃数学难题。在FrontierMath基准测试的Tier 4级别（最难的一档）里，它解开了48道私密题中的23道，正确率48%，比GPT-5.5 Pro的39.6%高出一截。测试条件给得挺宽松：48小时不限token，相当于让AI慢慢想。牛津大学教授Marc Lackenby还用它证明了一个悬而未决的群论猜想，这是实打实的数学贡献。

不过得打个折。FrontierMath的Tier 4题目是私密的，外界没法验证，正确率全靠谷歌自报。48小时不限token的设定也离实际使用场景比较远，成本和时间开销都没披露。系统架构、智能体之间怎么分工协作这些关键细节，正文也没展开。

这条新闻值得关注的点在于，它展示了多智能体协作在专业推理上的潜力，而且产出了可验证的数学成果。但缺的东西也很明显：公开可复现的测试集、资源消耗数据、以及更透明的系统设计。在这些补上之前，先当它是一个有亮点的实验室demo看。
