# OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上跑出 99.9%，花了一万九千美元

> 原标题：OpenAI's GPT-6 Astra on ARC-AGI-3

- 来源：Hacker News 首页
- 发布时间：2026-09-03T19:45:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54618
- 原文：https://arcprize.org/blog/astra

## 摘要

GPT-6 Astra 在 ARC-AGI-3 这个测试智能体探索、建模和规划能力的基准上拿了两个高分。用标准接口（模型自己记笔记）最高分是 62.7%，成本两万六千美元；换成厂商适配接口（保留推理状态、压缩长对话）后，高推理档直接干到 99.9%，成本反而降到一万九千美元。它比人类中位数更省动作，在 96% 的关卡里用的步数更少。一个有意思的行为是，...

## 推荐理由

GPT-6 Astra 在 ARC-AGI-3 上拿了 99.9%，是第一个在这个基准上接近满分的旗舰模型，成本还降了。这个结果来自 ARC Prize 官方博客，不是 OpenAI 自己发的，所以权威性上我会先打个折，但跨源覆盖是板上钉钉的。没给 95+ 是因为正文没披露 Astra 的架构细节和训练数据，信息有缺口。

## 锐评

这条消息最值得看的是两个分数之间的巨大落差。用标准接口，让模型自己记笔记、一步步推理，GPT-6 Astra 在 ARC-AGI-3 半公开测试集上拿了 62.7%，花了 2.6 万美元。换成厂商适配接口，也就是允许模型保留内部推理状态、压缩长对话记录，分数直接跳到 99.9%，成本反而降到 1.9 万美元。这说明模型本身的底子够强，但让它像人一样边看边记、边想边做，效率会大打折扣；一旦给了“草稿纸”和“记忆外挂”，表现就接近完美。

另一个有意思的点是动作效率：Astra 在 96% 的关卡里用的步数比人类中位数还少。它还能把陌生环境抽象成符号化的世界模型，甚至自己发明了一套简写符号来跟踪状态和规划行动。这比单纯刷分更能体现模型在理解规则和规划上的进步。

不过，这篇博客没提模型参数量、架构和发布时间，也没说这个适配接口到底在多大程度上替模型做了结构化预处理。如果接口本身承担了部分推理工作，那 99.9% 这个数字就得打个折。另外，ARC-AGI-3 本身是人类能 100% 通过的测试，Astra 在标准接口下的 62.7% 说明离真正的通用智能还有距离，别被 99.9% 冲昏头。
