# OpenAI 搞了个 MLE-bench，用 75 个 Kaggle 比赛来考 AI 的机器学习工程能力

> 原标题：MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering

- 来源：OpenAI News
- 发布时间：2024-10-10T10:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/691
- 原文：https://openai.com/index/mle-bench

## 摘要

OpenAI 从 Kaggle 挑了 75 个真实比赛做成基准测试，让 AI 智能体自己训练模型、处理数据、跑实验。最强的组合是 o1-preview 配上 AIDE 脚手架（一种帮模型自动迭代代码的工具），在 16.9% 的比赛里拿到了至少铜牌水平。这个成绩说明模型能独立完成一些 ML 工程任务，但离真正拿金牌还差得远。团队还研究了多给算力、多跑几次...

## 推荐理由

OpenAI 这次没让模型刷题，而是让它真刀真枪跑完 75 个 Kaggle 竞赛——从准备数据、训模型到交结果，整套 ML 工程流程都得自己来。最佳组合 o1-preview + AIDE 在 16.9% 的任务里摸到了铜牌线，说明能做一些，但离靠谱还差得远。我会先打个折：铜牌在 Kaggle 上不算难，正文也没披露具体是哪些任务、失败在哪类环节，所以别急着喊“替代 ML 工程师”。真正值得看的是它把评测从“会答题”扭到了“能干完整工程活”，而且代码开源，团队可以自己跑一遍看自家 agent 几斤几两。

## 锐评

OpenAI 把 Kaggle 上 75 个真实比赛打包成一个叫 MLE-bench 的基准，让 AI 智能体自己训练模型、处理数据、跑实验。最强的组合是 o1-preview 配上 AIDE 这个能帮模型自动迭代代码的工具，结果在 16.9% 的比赛里拿到了至少铜牌水平。这个数字说明模型确实能独立完成一些 ML 工程任务，但别急着激动——铜牌在 Kaggle 上通常只是提交了一个勉强能用的方案，离真正拿金牌、稳定产出高质量模型还有很大距离。

团队还研究了多给算力、多跑几次能不能提分，以及训练数据有没有提前见过这些比赛题目。正文没披露具体的资源消耗和延迟数据，也没说这些智能体在失败的任务上是怎么翻车的。另外，测试只用了 Kaggle 比赛这种有明确评分标准的环境，跟实际工作中需求模糊、数据脏乱的场景差别不小。想知道这东西能不能真放进业务流程干活，还得看它在没有标准答案的任务上表现如何。
