OpenAI 这次发布的 GPT-6 Astra,定价直接对标 Claude Fable 5/5.1,输入每百万 token 10 美元,输出 50 美元,摆明了要抢市场。最唬人的 ARC-AGI 3 基准测试拿了 99.9%,但得拆开看:这个分数是靠 OpenAI 自己写的“Provider Adapter harness”跑出来的,成本 1.9 万美元。这个定制工具会在多次请求之间保留模型的推理状态,并对长对话做压缩,相当于让模型能“记住”之前的思考,复用成果。而用官方默认工具跑,得分只有 62.7%,成本反而更高,要 2.6 万美元。所以这个 99.9% 不能直接拿来跟其他模型比,正文也没披露 Fable 5 在这项测试上的成绩,没法判断真实差距。
在安全任务上,Astra 确实强。ExploitBench 拿了满分 100%,比上一代 Sol 的 78.5% 高出一截;SRE-Bench 逆向工程 99.2% 的得分也远超 Sol 的 68.7%。长文本检索在 25 万到 50 万 token 区间能做到 100% 准确,50 万到 100 万区间也有 96.3%,说明 OpenAI 在长上下文处理上解决了一些老问题。
不过,在第三方机构 Artificial Analysis 的通用智能指数上,Astra 和上一代 Sol 打了个平手,都是 61 分,比 Claude Fable 5.1 低了 5 分,也落后于 Meta 新发的 Muse Spark 1.3。它的优势在编程成本效率上:同样跑满算力,Astra 成本跟 Sol 差不多,但分数高 2 分;要达到 Fable 5 同样的编程分数,Astra 的单任务成本不到 Fable 的一半。目前作者 Simon 自己还没拿到试用权限,API 标签会是 gpt-6-astra,实际体感如何还得等上手。