# WhatWorkedBench 研究发现 AI 研究代理选中最优配置仍难准确预测未测实验

> 原标题：AI 研究代理挑中了最好的实验配置，却猜不准剩下的每一种

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-10-02T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/rb4vkizogubovzmpy4a3nhmoj
- 原文：https://yage.ai/share/whatworkedbench-experimental-understanding-20260928.html

## 摘要

卡耐基梅隆大学和清华大学团队提出 WhatWorkedBench，评测 AI 研究代理能否利用有限实验预测未测配置，发现选中最优配置与理解实验效应存在差距。基准涵盖 30 个数据源、8 类工作流和 1248 个配置，同批观测下代理的效应还原度为 0.632，高斯过程为 0.698；修复代理违反的代码约束后，平均还原度从 0.338 提升至 0.507，无需新增实验。
