VISTA 在 ARC-AGI-3 公开关卡拿到满分,为何出题人不认可其通用智能含义
模型在 AGI 基准 ARC-AGI-3 上拿到满分,出题人却说这不算数
MIT 团队的 VISTA 在 ARC-AGI-3 的 25 个公开游戏环境中全部通关,但公开测试成绩不进入官方正式排行榜。系统未修改模型权重,主要增加图像表示、无损历史存档和回看工具;纯文本系统 AVO 同样全部通关,交互动作比 VISTA 少约 12%,但两者差异不止输入模态,不能视为受控消融实验。
模型在 AGI 基准 ARC-AGI-3 上拿到满分,出题人却说这不算数
MIT 团队的 VISTA 在 ARC-AGI-3 的 25 个公开游戏环境中全部通关,但公开测试成绩不进入官方正式排行榜。系统未修改模型权重,主要增加图像表示、无损历史存档和回看工具;纯文本系统 AVO 同样全部通关,交互动作比 VISTA 少约 12%,但两者差异不止输入模态,不能视为受控消融实验。