# AI 研究即将全自动：Jack Clark 预测 2028 年底前，AI 自己造自己的概率超过六成

> 原标题：Import AI 455: Automating AI Research

- 来源：Import AI
- 发布时间：2026-05-04T12:32:09.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/17511
- 原文：https://jack-clark.net/2026/05/04/import-ai-455-automating-ai-research/

## 摘要

Jack Clark 根据公开数据做了一个判断：到 2028 年底，不需要人类插手的 AI 研发有超过 60% 的概率会出现。他主要拿两个指标说事。一个是 SWE-Bench，这个测试看 AI 能不能解决 GitHub 上的真实代码问题，Claude 2 当初得分大概 2%，现在 Claude Mythos Preview 已经干到 93.9%，基本把...

## 推荐理由

HKR 三项全中。Jack Clark 用 SWE-Bench 和 METR 的数据撑起一个 2028 年全自动 AI 研发的赌注，属于知名人物对 AI 时间线的判断，放在 85–94 分档合适，比模型发布的分量低一点。

## 锐评

Jack Clark 这篇不是论文，是他自己看了一堆公开数据后做的推演。核心判断很直白：AI 自己搞研发，2028 年底前发生的概率超过 60%。他主要抓了两个指标。一个是 SWE-Bench，测 AI 解决 GitHub 真实代码问题的能力，Claude 2 当初得分约 2%，现在 Claude Mythos Preview 已经干到 93.9%，基本把题库刷穿了。另一个是 METR 的任务时长，看 AI 能稳定完成多复杂的活，从 2022 年 GPT-3.5 的 30 秒，一路涨到 2026 年 Opus 4.6 的约 12 小时，METR 的人甚至觉得年底摸到 100 小时不奇怪。

这两个趋势合在一起，说明 AI 写代码和长时间干活的能力都在猛涨，工程层面的自动化拼图快齐了。但 Clark 自己也留了余地：前沿大模型的训练太贵，需要一堆人拼命调，短期内还很难完全甩开人类。正文没给出具体的成本模型或实验验证，更多是趋势外推。

我会先打个折：代码能力饱和不等于研究能力到位，从“会写代码”到“能提出新研究方向”中间还隔着创造力这道坎。另外，METR 的任务时长测的是人类标注的通用任务，不是真实的 AI 研发流程，直接套用有水分。这篇最值钱的地方是把散落各处的公开数据点串成了一条清晰的趋势线，但结论本身还缺一次真正的端到端实验来撑腰。
