# ARC Prize 发布 ARC-AGI-3 排行榜，按性价比给 AI 系统排座次

> 原标题：ARC-AGI Leaderboard

- 来源：Hacker News 首页
- 发布时间：2026-07-25T06:31:40.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/46531
- 原文：https://arcprize.org/leaderboard

## 摘要

ARC Prize 放出了 ARC-AGI-3 的官方验证排行榜。这个新测试不再只看模型坐着答题，而是让 AI 智能体进入实时变化的交互环境里临场应变。排行榜最显眼的是张散点图，横轴是每道题的花费，纵轴是得分，直接把性价比摆到台面上。图上只展示运行总成本低于 1 万美元的系统；如果是 Kaggle 竞赛方案，还有 50 美元算力封顶的限制。具体哪个模型...

## 推荐理由

ARC Prize 放出了 ARC-AGI-3 的官方验证排行榜，核心变化是从静态做题变成让 AI 智能体进实时交互环境里应变，并且用散点图把得分和单题成本直接挂上钩，低于 1 万美元总成本才上榜，Kaggle 方案还有 50 美元算力封顶。但文章本身只是导航页，没披露任何模型名称或实际分数，信息太薄，只能给 featured 档。

## 锐评

ARC-AGI-3 这个新榜单不再让模型坐着答题，而是扔进实时变化的交互环境里看它临场应变。最狠的设计是把每道题的花费和得分做成散点图，横轴是成本，纵轴是成绩，直接告诉你谁在烧钱换分、谁是真省。图上只展示总运行成本低于 1 万美元的系统，Kaggle 竞赛方案更狠，120 道题只给 50 美元算力封顶。

不过这篇公告本身没披露任何具体模型名或分数，想看排名得自己点进页面。另外，正文提到部分结果标了“preview”，说明测试还不完整，分数可能有水分。图上那些推理系统的趋势线也值得留意——它们通常显示思考时间加长后收益递减，别一看到高分就以为无限堆算力有用。

还缺什么：没说明交互环境的具体复杂度，也没交代不同模型在哪些类型的任务上翻车。光看性价比曲线，不知道是卡在理解指令还是卡在操作执行。
