# GPT-6 Astra 在 ARC-AGI-3 上拿了 99%，Greg Brockman 说这个基准已经被打穿了

> 原标题：Greg Brockman 转发：GPT-6 Astra 在 ARC-AGI-3 达到 SOTA，基准趋于饱和

- 来源：AI HOT 精选
- 发布时间：2026-09-03T21:46:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54621
- 原文：https://x.com/gdb/status/2095629409017614390

## 摘要

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 测试里跑到了 99% 的正确率，96% 的题目表现超过人类。不过这个成绩不是默认跑出来的——标准测试流程只给了 63%，是换了一套叫 Provider Adapter 的测试框架后才冲到 99%。排行榜上还有个反直觉的现象：推理能力越强的版本反而越省钱，因为 Astra 解题步骤少，调模...

## 推荐理由

Greg Brockman 转发让这条消息自带关注度，99% 的成绩也确实是个行业事件。但我会先打个折——默认跑只有 63%，靠 Provider Adapter 才冲到 99%，这个差距正文没完全解释清楚，所以不能当纯模型能力来看。基准本身快饱和了，以后在这个指标上拉不开差距，这点先别太激动。整体值得上 featured，但分数留点余地。

## 锐评

Greg Brockman 转发了这条结果，等于官方盖章了。但成绩本身水分不小：标准测试流程只给了 63%，换了一套叫 Provider Adapter 的框架才拉到 99%。这说明分数高度依赖测试方式，不是模型本身稳定达到了这个水平。排行榜上还有个反直觉的现象——推理能力越强的版本反而越省钱，因为 Astra 解题步骤少，调模型次数和 token 消耗都降下来了。如果这个数据真实，意味着更强的推理不一定更贵，这点对实际落地挺关键。

不过正文没披露 Provider Adapter 具体改了什么，也没说 96% 超越人类是在哪些题目上、人类基线是怎么测的。ARC-AGI-3 本身的设计目标和难度也没交代。Brockman 说基准已饱和，但饱和是因为题目太简单还是模型真变强了，光看一个数字没法判断。想看这个结果的真实含金量，得等 ARC Prize 那边放出完整的测试配置和人类对比数据。
