跳到正文
Computing Life · Share · 鸭哥调研

VISTA 在 ARC-AGI-3 公开关卡拿到满分,为何出题人不认可其通用智能含义

模型在 AGI 基准 ARC-AGI-3 上拿到满分,出题人却说这不算数

MIT 团队的 VISTA 在 ARC-AGI-3 的 25 个公开游戏环境中全部通关,但公开测试成绩不进入官方正式排行榜。系统未修改模型权重,主要增加图像表示、无损历史存档和回看工具;纯文本系统 AVO 同样全部通关,交互动作比 VISTA 少约 12%,但两者差异不止输入模态,不能视为受控消融实验。

读原文 ↗导出 Markdown