# Schema 这套外挂让前沿模型在 ARC-AGI-3 公开集上跑到了约 99% 的得分

> 原标题：Schema Harness Achieves ~99% on Arc‑AGI‑3 Public

- 来源：Hacker News 首页
- 发布时间：2026-07-16T15:29:12.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/44777
- 原文：https://schema-harness.github.io/

## 摘要

Impossible Research 发了个叫 Schema 的调度框架，没动模型本身，而是让 Claude Opus 4.8 和 GPT-5.6 Sol 像物理学家一样干活：先把游戏画面转成可执行的状态程序，再找出游戏机制，并把两者塞进同一个可编辑的程序里。这样预测翻车时，模型能回头改自己对“状态是什么”的定义，而不是只修规则。在 ARC-AGI-...

## 推荐理由

99% 在 ARC-AGI-3 上是个硬成绩，方法不是新模型而是一个调度框架，对 agent 设计有直接参考价值。扣分点在于目前只有项目页，没完整论文，机制细节和可复现性还得等验证。

## 锐评

Impossible Research 发了个叫 Schema 的调度框架，核心思路是让模型像物理学家一样干活：先把游戏画面转成可执行的状态程序，再找出游戏机制，并把两者塞进同一个可编辑的程序里。这样预测翻车时，模型能回头改自己对“状态是什么”的定义，而不是只修规则。用这套方法，Claude Opus 4.8 在 ARC-AGI-3 公开集上跑到 99% RHAE，GPT-5.6 Sol 跑到 95.35%。RHAE 这个指标是和人类首次通关的动作效率比，100% 意味着达到或超过人类水平。

需要先打个折：这两个分数都是团队自报的，还没经过 ARC Prize 官方验证。另外，正文完全没提推理延迟和单次运行成本。ARC-AGI-3 本身是个不给规则、不给物体列表、不给奖励的游戏环境，模型只能靠试错来猜规则，之前最好的公开验证成绩才 13.33%。如果 Schema 的分数最终被证实，说明“怎么用模型”比模型本身大小重要得多。但现阶段，验证缺失和成本信息空白让这个 99% 还只能当个参考。
