# ARC-AGI-3 发布半年就被 Astra 打穿，比 Chollet 预估快了一倍

> 原标题：ARC-AGI-3 发布仅半年即被 Astra 饱和，进展快于 François Chollet 预期一倍

- 来源：AI HOT 精选
- 发布时间：2026-09-03T20:23:49.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54612
- 原文：https://x.com/sherwinwu/status/2095608725730119733

## 摘要

Sherwin Wu 说他之前觉得 ARC-AGI-3 挺难的，现在 Astra 已经把它跑饱和了。François Chollet 原本预计前沿模型要花一年左右才能做到，结果只用了 6 个月。正文没披露 Astra 的具体分数和测试细节，所以这个结论先打个折，等完整结果出来再看。

## 推荐理由

ARC-AGI-3 半年就被饱和，比 Chollet 预期快了一倍，这个信号很强，直接更新了对推理进展的认知。但正文没给出 Astra 的具体分数和测试条件，所以结论先打个七折。如果后续有完整报告出来，重要性还能往上走。

## 锐评

ARC-AGI-3 是 François Chollet 团队设计的抽象推理基准，用来测模型能不能在没见过的规则下解题，比前两代更难。Chollet 发布时判断前沿模型要一年才能饱和，结果 Astra 只用了 6 个月，速度翻倍。Sherwin Wu 的帖子确认了这件事，但没披露 Astra 的具体得分、测试轮次、是否用了额外训练数据或工具辅助。这些信息缺口让"饱和"的含金量没法判断——是刚好过线还是碾压式高分，是纯模型推理还是接了代码执行环境，差别很大。另外，ARC-AGI-3 本身的设计目标就是防刷榜，如果 Astra 是靠规模硬堆上去的，那说明基准的区分度可能没设计者想的那么高。等完整报告出来再看，现在只能说进展确实快，但快在哪、怎么快的，还不清楚。
