跳到正文
热点事件持续更新

WhatWorkedBench揭示AI代理实验理解差距

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

10月2日报道,卡耐基梅隆大学和清华大学团队提出WhatWorkedBench,评测AI研究代理能否利用有限实验预测未测配置。该基准涵盖30个数据源、8类工作流和1248个配置,研究发现,选中最优配置与理解实验效应之间存在差距。在同批观测下,代理的效应还原度为0.632,低于高斯过程的0.698。团队还发现,修复代理违反的代码约束后,无需新增实验,平均还原度即可从0.338提升至0.507。

AI 根据报道生成 · 47 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. Computing Life · Share · 鸭哥调研
    WhatWorkedBench 研究发现 AI 研究代理选中最优配置仍难准确预测未测实验

    卡耐基梅隆大学和清华大学团队提出 WhatWorkedBench,评测 AI 研究代理能否利用有限实验预测未测配置,发现选中最优配置与理解实验效应存在差距。基准涵盖 30 个数据源、8 类工作流和 1248 个配置,同批观测下代理的效应还原度为 0.632,高斯过程为 0.698;修复代理违反的代码约束后,平均还原度从 0.338 提升至 0.507,无需新增实验。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。