跳到正文
AI HOT 精选

GPT-6 Astra 在 ARC-AGI-3 上拿了 99%,Greg Brockman 说这个基准已经被打穿了

Greg Brockman 转发:GPT-6 Astra 在 ARC-AGI-3 达到 SOTA,基准趋于饱和

OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 测试里跑到了 99% 的正确率,96% 的题目表现超过人类。不过这个成绩不是默认跑出来的——标准测试流程只给了 63%,是换了一套叫 Provider Adapter 的测试框架后才冲到 99%。排行榜上还有个反直觉的现象:推理能力越强的版本反而越省钱,因为 Astra 解题步骤少,调模...

推荐理由:Greg Brockman 转发让这条消息自带关注度,99% 的成绩也确实是个行业事件。但我会先打个折——默认跑只有 63%,靠 Provider Adapter 才冲到 99%,这个差距正文没完全解释清楚,所以不能当纯模型能力来看。基准本身快饱和了,以后在这个指标上拉不开差距,这点先别太激动。整体值得上 featured,但分数留点余地。

读原文 ↗导出 Markdown