# Nvidia 用一套外挂流程把非顶尖模型在 ARC-AGI 3 上拉到满分，说明现在干活靠的是“缰绳”而不是模型本身

> 原标题：Nvidia just showed that the harness, not the AI model, is now the real hero

- 来源：TechCrunch · AI
- 发布时间：2026-08-21T19:43:39.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52199
- 原文：https://techcrunch.com/2026/08/21/nvidia-just-showed-that-the-harness-not-the-ai-model-is-now-the-real-hero/

## 摘要

Nvidia 发了篇研究，用他们叫 AVO 的一套外挂流程（负责规划、纠错和记忆），让一个不是最前沿的模型在 ARC-AGI 3 测试里拿了 100% 的成绩。这相当于说，让 AI 处理长链条任务时，外围的调度和纠错机制比模型自身能力强弱更关键。不过文章没提底层模型叫什么、参数量多大、跑一次要多久、成本多少，所以这点先别太激动，离实际能用还有信息缺口。

## 推荐理由

Nvidia 用一套叫 AVO 的外挂流程，让一个不是最前沿的模型在 ARC-AGI 3 测试里直接拿了满分。这相当于说，处理长链条任务时，外围的规划、纠错和记忆机制比模型自身强不强更关键。我会先打个折：正文没披露底层模型叫什么、参数量多大、跑一次要多久、成本多少，所以这个 100% 暂时别太激动，离实际落地还有信息缺口。但观点本身对从业者选型有直接冲击，值得推。

## 锐评

这条消息值得点开，因为它把“模型不够强怎么办”这个问题换了个解法：不换模型，换外挂。Nvidia 这套 AVO 系统负责规划、纠错和记忆，相当于给一个普通模型配了个很能干的工头，结果在 ARC-AGI 3 这种需要多步推理的测试里直接拉满 100%。

不过我会先打个折。文章完全没提底层模型叫什么、参数量多大、跑一次要多久、花多少钱。ARC-AGI 3 本身也不是真实业务场景，满分只能说明这套流程在这个特定测试上很灵，不代表扔到客服、数据分析这类活里就能直接省钱。另外，AVO 是 Nvidia 自己发的论文，没有第三方复现，这点先别太激动。

还缺什么：模型规模、推理延迟、单次任务成本、在更乱的真实数据上的表现。如果这些数字出来，我们才能判断这到底是“外挂真能省钱”还是“实验室里的漂亮分数”。
