# OpenAI 发布 GPT-6 Astra，ARC-AGI 3 得分 99.9%，但这个分数水分很大

> 原标题：OpenAI 发布 GPT-6 Astra，ARC-AGI 3 得分 99.9%

- 来源：AI HOT 精选
- 发布时间：2026-09-03T20:18:41.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54614
- 原文：https://simonwillison.net/2026/Sep/3/gpt6-astra

## 摘要

GPT-6 Astra 今天开始向部分机构推送，接下来几天会覆盖 ChatGPT Plus、Pro、Business、Enterprise 和 API 用户。API 价格跟 Claude Fable 5/5.1 一样，输入每百万 token 10 美元，输出 50 美元，摆明了是冲着 Fable 来的。最唬人的是 ARC-AGI 3 基准测试拿了 99...

## 推荐理由

GPT-6 Astra 就是冲着 Claude Fable 来的，价格完全照搬，输入 10 美元、输出 50 美元每百万 token。最唬人的 ARC-AGI 3 拿了 99.9%，但正文说了，这是用定制测试框架跑出来的，换成默认框架直接掉到 62.7%，所以这个近乎满分的数字得打个大折扣。不过就算打折，它也是第一个在这个新基准上公开露脸的模型，同行肯定会拿来拆解。安全方面 ExploitBench 从 78.5% 拉到 100%，是个实打实的提升。整体看，OpenAI 这次就是要在定价和跑分上跟 Anthropic 正面硬刚，信息量够大，值得立刻推。

## 锐评

OpenAI 这次发布的 GPT-6 Astra，定价直接对标 Claude Fable 5/5.1，输入每百万 token 10 美元，输出 50 美元，摆明了要抢市场。最唬人的 ARC-AGI 3 基准测试拿了 99.9%，但得拆开看：这个分数是靠 OpenAI 自己写的“Provider Adapter harness”跑出来的，成本 1.9 万美元。这个定制工具会在多次请求之间保留模型的推理状态，并对长对话做压缩，相当于让模型能“记住”之前的思考，复用成果。而用官方默认工具跑，得分只有 62.7%，成本反而更高，要 2.6 万美元。所以这个 99.9% 不能直接拿来跟其他模型比，正文也没披露 Fable 5 在这项测试上的成绩，没法判断真实差距。

在安全任务上，Astra 确实强。ExploitBench 拿了满分 100%，比上一代 Sol 的 78.5% 高出一截；SRE-Bench 逆向工程 99.2% 的得分也远超 Sol 的 68.7%。长文本检索在 25 万到 50 万 token 区间能做到 100% 准确，50 万到 100 万区间也有 96.3%，说明 OpenAI 在长上下文处理上解决了一些老问题。

不过，在第三方机构 Artificial Analysis 的通用智能指数上，Astra 和上一代 Sol 打了个平手，都是 61 分，比 Claude Fable 5.1 低了 5 分，也落后于 Meta 新发的 Muse Spark 1.3。它的优势在编程成本效率上：同样跑满算力，Astra 成本跟 Sol 差不多，但分数高 2 分；要达到 Fable 5 同样的编程分数，Astra 的单任务成本不到 Fable 的一半。目前作者 Simon 自己还没拿到试用权限，API 标签会是 gpt-6-astra，实际体感如何还得等上手。
