谷歌搞了个“AI 联合数学家”,用多智能体协作刷了最难数学基准的新纪录
谷歌「AI联合数学家」来了!刷新最难数学AI基准SOTA,牛津教授用它解开群论悬案
谷歌 DeepMind 发布了一个叫 AI Co-Mathematician 的系统,它不是单个模型,而是一套异步协作的智能体工作区,专门用来做数学研究。在 FrontierMath 这个目前最难的数学基准测试里,它解开了 48 道 Tier 4 级私密题中的 23 道,正确率 48%。对比之下,GPT-5.5 Pro 的正确率是 39.6%。测试条件...
推荐理由:我会先打个折:正文没披露模型架构、训练数据和具体成本,所以没法判断这 48% 的含金量到底多实。但故事本身很抓人——牛津教授用这个系统解开了一个群论悬案,同时 FrontierMath Tier 4 这种非公开难题集上的成绩比 GPT-5.5 Pro 高了 8 个多点,说明在极难数学推理上确实往前走了一步。对做推理和 agent 的人来说,这是个值得盯的信号,但别急着把它当成通用数学家的雏形。