# OpenAI 只改了两项 API 设置，就让 GPT-5.6 在 ARC-AGI-3 上的得分翻了三倍

> 原标题：启用两项 API 设置使 GPT-5.6 在 ARC-AGI-3 基准测试得分提升三倍

- 来源：AI HOT 精选
- 发布时间：2026-07-29T15:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47474
- 原文：https://openai.com/index/how-two-settings-tripled-our-arc-agi-3-scores

## 摘要

GPT-5.6 Sol 在 ARC-AGI-3 基准测试上最初只拿了 7.8% 的总分，公开集也才 13.3%，远低于人类测试者约 48% 的平均水平。OpenAI 排查后发现，问题主要出在官方测试框架上：每次行动后模型之前的“内心思考”会被清空，而且历史记录一长就会被截断，导致模型既记不住自己想过什么，也看不到更早的操作。换成 OpenAI 自己的 ...

## 推荐理由

OpenAI 官方发的排查帖，有数字有根因，不是公关稿。分数没给总分，所以上限压在 85。核心价值是工程教训：不是模型不行，是测试管线在坑模型，这对搭 agent 的人直接可用。

## 锐评

OpenAI 这篇博文讲了一个挺实在的事：GPT-5.6 Sol 在 ARC-AGI-3 这个 2D 解谜基准上最初只拿了 7.8% 总分，公开集也才 13.3%，远低于人类约 48% 的平均水平。排查后发现，锅主要不在模型能力，而在官方测试框架的设计——每次行动后模型之前的“内心思考”会被清空，历史记录一长就被截断，导致模型既记不住自己想过什么，也看不到更早的操作。换成 OpenAI 自己的 Responses API，保留推理过程并启用上下文压缩后，公开集得分直接跳到 38.3%，输出 token 量反而降到原来的六分之一。

这个对比说明，基准测试的“公平性”有时会牺牲模型实际能发挥的上限。官方框架追求通用、简单，但商业模型往往需要配套的工程设置才能跑出真实水平。不过文章没披露完整私有集的结果，也没说这两项设置对其他模型是否同样有效。另外，人类测试者 48% 的平均分本身也不算高，说明这个基准对人和机器都挺难，38.3% 离人类还有距离，但差距已经大幅缩小。

还缺什么：私有集完整分数、不同模型用同样设置后的横向对比、以及这两项设置在更多任务类型上的泛化验证。
