# GPT-6 Astra 在 ARC AGI-3 跑出 98.6% 别激动，OpenAI 用了自家改装套件

> 原标题：On GPT-6 Astra 98.6% ARC AGI-3: don't fall for the hype

- 来源：r/LocalLLaMA
- 发布时间：2026-09-04T09:11:33.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54754
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1w6z731/on_gpt6_astra_986_arc_agi3_dont_fall_for_the_hype/

## 摘要

OpenAI 宣称 GPT-6 Astra 在 ARC AGI-3 基准上拿了 98.6%，但用的是他们自己定制的测试套件，不是官方标准版。Nvidia 之前用自家的 AVO 套件已经跑到了 100%，更早的 Arc-Skill 和 VISTA 系统也接近满分。换成标准套件后，Astra 的成绩掉到 66%。这个分数依然不错，但远没到 AGI。Open...

## 推荐理由

这篇文章用两个数字拆掉了 OpenAI 的 98.6% 叙事——Nvidia 的 100% 和标准套件下的 66%，信息密度高，冲突直接。没给更高分是因为来源是 Reddit 个人帖，不是机构评测，正文也没披露标准套件的具体测试条件和样本量，验证力度有限。

## 锐评

OpenAI 宣称 GPT-6 Astra 在 ARC AGI-3 基准上拿了 98.6%，听起来很吓人，但这条帖子直接戳破了泡泡：他们没用官方标准测试套件，而是自己定制了一套。Nvidia 之前用自家的 AVO 套件已经跑到了 100%，更早的 Arc-Skill 和 VISTA 系统也接近满分，所以用定制套件刷高分不是新鲜事。

关键数字在这里：换成标准套件后，Astra 的成绩掉到 66%。这个分数依然不错，说明模型推理能力有实质进步，但远没到 AGI。帖子没详细说 OpenAI 的定制套件到底改了啥，有评论提到可能只是保留了对话历史，这在实际使用中很常见，但拿来当公关 headline 就不太老实。

我会先给 98.6% 这个数字打个折。目前缺的是 OpenAI 对定制套件具体改动的说明，以及标准套件下更细分的错误分析。没有这些，这个高分更像是一次精心策划的营销，而不是技术突破。
