# OpenAI 放出 GPT-6 Astra，几个硬核基准刷到第一

> 原标题：OpenAI 发布 GPT-6 Astra，多项基准达到 SOTA

- 来源：AI HOT 精选
- 发布时间：2026-09-03T20:22:52.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54613
- 原文：https://x.com/sherwinwu/status/2095608486940086448

## 摘要

OpenAI 发了条推，说 GPT-6 Astra 在 FrontierMath Tier 4、ARC-AGI 3 和 TerminalBench-4.0 上拿了 SOTA，Terminal-Bench Science 0.1 和 HealthBench Pro 的分数也领先。但正文只有一串基准名字，没给参数量、架构、发布时间，连具体分数都没放。我会先...

## 推荐理由

GPT-6 Astra 代号和 SOTA 声明本身就有新闻性，但正文只列了基准名称，零具体数字、零架构细节、零时间线。按规则信息越薄越往低档靠，82 落在 78-84 区间里。

## 锐评

这条消息本质上是一则预告，不是产品发布。OpenAI 在推上列了五个基准：FrontierMath Tier 4 测高难数学推理，ARC-AGI 3 测抽象模式识别，TerminalBench-4.0 和 Science 0.1 测代码与科学任务，HealthBench Pro 测医疗问答。声称在这些项目上拿了 SOTA 或领先成绩，但正文没披露任何具体分数、参数量、架构细节或发布时间。

对从业者来说，这串基准名字本身有一定信息量——说明 OpenAI 在往数学、代码、科学和医疗这几个方向押注评测。但没数字就没法判断领先幅度有多大，是碾压还是险胜。另外，FrontierMath Tier 4 和 TerminalBench 都不是大众熟知的通用基准，样本量、题型分布、评分方式这些正文都没提，验证难度高。

我会先打个折：等白皮书或第三方评测出来再看。如果这些基准本身样本少、任务窄，SOTA 的含金量就要缩水。还缺的关键信息包括：模型规模、推理成本、是否开源权重、以及跟 GPT-5 的实际体验对比。
