# OpenAI 在 GPT-6 Astra 发布后反复修改跑分，幻觉率一度从 4.2% 砍半到 2% 又改回去

> 原标题：Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据，部分成绩大幅变化

- 来源：AI HOT 精选
- 发布时间：2026-09-06T06:46:16.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55072
- 原文：https://www.ithome.com/0/998/927.htm

## 摘要

Fortune 发现 OpenAI 在 9 月 3 日发布 GPT-6 Astra 后，多次悄悄修改了官方博客里的基准测试成绩。最夸张的是 Astra 的幻觉率，先是从 4.2% 降到 2%，后来又改回了 4.2%。Anthropic 的模型 Fable 5.1 也遭了殃，数学成绩一度被 OpenAI 下调了近 10 分。OpenAI 解释说这是发布前...

## 推荐理由

GPT-6 Astra 发布本身就是大事，Fortune 抓到发布后改基准测试成绩，还动了竞品分数，热点、知识增量、读者决策影响全占了。没给到 95 是因为目前只有 Fortune 一家报道，OpenAI 的回应也比较模糊，先观望一下后续。

## 锐评

这件事最值得关注的点不是分数本身，而是修改的过程。Fortune 抓到了网页快照，显示 Astra 的幻觉率先从 4.2% 砍半到 2%，后来又改了回去；Anthropic 的模型 Fable 5.1 数学成绩一度被 OpenAI 下调了近 10 分。OpenAI 解释这是发布前的正常验证，但斯坦福的研究人员指出，系统卡里根本没写清楚幻觉测试到底用了多少样本、怎么测的。

我会先打个折：博客里也写了，这些都是在不计计算成本、用最强配置跑出来的“天花板分数”，普通用户用 ChatGPT 根本跑不出这个效果。所以这些数字更多是实验室里的营销素材，不是实际体验。

现在还缺两个关键信息：一是 OpenAI 到底有没有一套固定的、公开的测试流程，还是每次发布前可以反复调参直到数字好看为止；二是这些修改是在媒体和公众发现之后才改回去的，如果没人盯着，是不是就默认用那个更低的幻觉率了。这点先别太激动，等 OpenAI 把测试方法和原始数据公开再说。
