Nvidia 用一套外挂流程把非顶尖模型在 ARC-AGI 3 上拉到满分,说明现在干活靠的是“缰绳”而不是模型本身
Nvidia 发了篇研究,用他们叫 AVO 的一套外挂流程(负责规划、纠错和记忆),让一个不是最前沿的模型在 ARC-AGI 3 测试里拿了 100% 的成绩。这相当于说,让 AI 处理长链条任务时,外围的调度和纠错机制比模型自身能力强弱更关键。不过文章没提底层模型叫什么、参数量多大、跑一次要多久、成本多少,所以这点先别太激动,离实际能用还有信息缺口。
推荐理由:Nvidia 用一套叫 AVO 的外挂流程,让一个不是最前沿的模型在 ARC-AGI 3 测试里直接拿了满分。这相当于说,处理长链条任务时,外围的规划、纠错和记忆机制比模型自身强不强更关键。我会先打个折:正文没披露底层模型叫什么、参数量多大、跑一次要多久、成本多少,所以这个 100% 暂时别太激动,离实际落地还有信息缺口。但观点本身对从业者选型有直接冲击,值得推。