# 一个在5090上训练的小Transformer，花67美分在ARC-AGI-1上拿了44%

> 原标题：44% on ARC-AGI-1 in 67 cents

- 来源：Hacker News 首页
- 发布时间：2026-09-01T09:52:45.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54079
- 原文：https://mvakde.github.io/blog/44-on-arc-1/

## 摘要

Mithil Vakde 用一张 5090 显卡，花 1.5 小时、67 美分，从零训练了一个小 Transformer，在 ARC-AGI-1 公开评估集上拿到 44% 的正确率，跟 TRM/HRM 打平，在 ARC-2 上只有 7%。做法是把每个谜题的输入输出转成 token 序列，用 3D RoPE 和每个任务单独学的嵌入来做跨任务学习，推理时对...

## 推荐理由

44%的ARC-AGI-1正确率，成本只要67美分、1.5小时、单张5090——数字本身就是故事。3D RoPE和按任务学的嵌入给了可复现的技术钩子，不是泛泛而谈。ARC-2只有7%是硬伤，说明方法离通用推理还远，但也正是这个缺口让分数停在78分，没往上走。

## 锐评

Mithil Vakde 这次把成本压到了67美分，比他自己上一版更快更省，核心是换了现代模型结构（SwiGLU、RMSNorm）和更少的训练数据增强，反而让模型更会举一反三。一个反直觉的点是：他不再让模型去猜输入，只盯着输出训练，分数从40%涨到44%，但测试阶段的损失值反而变差了，他自己也没完全搞懂为什么。这提醒我们，在小样本场景下，一味追求更低的验证损失可能会跑偏。

做法上，他把每个谜题的输入输出转成token序列，用3D RoPE位置编码和每个任务单独学的嵌入来做跨任务学习，推理时靠数据增强加投票出结果。代码开源，不同运行结果取并集能到55%，说明稳定性还有提升空间。

目前最大的限制是只在ARC-1公开集上验证，ARC-2只有7%，泛化能力很弱。正文没披露在隐藏测试集上的成绩，也没说这方法换到其他推理任务上能不能用。如果后续能在更多基准上复现，并且把“只训输出”的原理搞清楚，这条低成本路线才真有说服力。
