# 单张 4090 跑出 11.67%：TOPAS 递归架构在 ARC-AGI-2 上的本地测试结果

> 原标题：11.67% ARC-AGI-2 Local Eval on a Single 4090: The TOPAS Recursive Architecture

- 来源：r/LocalLLaMA
- 发布时间：2026-05-07T20:56:47.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15613
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t6n97x/1167_arcagi2_local_eval_on_a_single_4090_the/

## 摘要

Doug_Bitterbot 用一张 RTX 4090 训练了大约 14 天，让 TOPAS 模型在 ARC-AGI-2 抽象推理测试上拿到了 11.67% 的分数。这个模型只有 1 亿参数，本地跑分最高到过 36%，但它的递归测试时训练（TTT）机制在 Kaggle 的题目上出了问题，将近一半的谜题直接输出空结果。作者觉得调一下阈值、再训 3 到 5...

## 推荐理由

Doug_Bitterbot 在 Reddit 上发了个帖子，说他的 TOPAS 架构在 ARC-AGI-2 公榜拿了 11.67%，跑在一张 RTX 4090 上，训练大概花了 14 天。模型参数约 100M，本地 checkpoint 能到 36%，但 Kaggle 提交时因为递归 TTT 超时，近一半题目输出空数组，分数被拉低。作者自己预期调一下阈值能到 20%，还说 3-5 周后再训完。这事有意思的地方在于，它只用输入图片来决定怎么压缩视觉 Token，多轮 VQA 里能砍掉 90% 的 Token，正文说精度不掉。不过目前只有一篇帖子，K...

## 锐评

Doug_Bitterbot 用一张 RTX 4090 跑了约 14 天，让 TOPAS 这个 1 亿参数的小模型在 ARC-AGI-2 抽象推理测试上拿到了 11.67% 的分数。本地跑分最高到过 36%，说明模型本身有潜力，但一到 Kaggle 的题目上就露怯了——将近一半的谜题直接输出空结果，原因出在它的递归测试时训练（TTT）机制上，相当于模型在答题时还要现场再学一遍，时间没控好就交白卷。作者自己判断，调一下阈值、再训 3 到 5 周，分数能拉到 20% 左右。

这条消息的价值在于证明了小模型加单卡也能碰一碰抽象推理，成本门槛确实低。但 11.67% 的绝对值还很低，而且正文没披露训练数据的具体构成、TTT 环节的延迟到底多大，也没说空输出是超时还是逻辑卡死。这些缺口让“再训几周就能涨分”的判断暂时只能当个方向，不能当定论。
