跳到正文
AI HOT 精选

OpenAI 只改了两项 API 设置,就让 GPT-5.6 在 ARC-AGI-3 上的得分翻了三倍

启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍

GPT-5.6 Sol 在 ARC-AGI-3 基准测试上最初只拿了 7.8% 的总分,公开集也才 13.3%,远低于人类测试者约 48% 的平均水平。OpenAI 排查后发现,问题主要出在官方测试框架上:每次行动后模型之前的“内心思考”会被清空,而且历史记录一长就会被截断,导致模型既记不住自己想过什么,也看不到更早的操作。换成 OpenAI 自己的 ...

推荐理由:OpenAI 官方发的排查帖,有数字有根因,不是公关稿。分数没给总分,所以上限压在 85。核心价值是工程教训:不是模型不行,是测试管线在坑模型,这对搭 agent 的人直接可用。

读原文 ↗导出 Markdown