WhatWorkedBench 研究发现 AI 研究代理选中最优配置仍难准确预测未测实验
AI 研究代理挑中了最好的实验配置,却猜不准剩下的每一种
卡耐基梅隆大学和清华大学团队提出 WhatWorkedBench,评测 AI 研究代理能否利用有限实验预测未测配置,发现选中最优配置与理解实验效应存在差距。基准涵盖 30 个数据源、8 类工作流和 1248 个配置,同批观测下代理的效应还原度为 0.632,高斯过程为 0.698;修复代理违反的代码约束后,平均还原度从 0.338 提升至 0.507,无需新增实验。