# DeepSeek研究员开源AutoResearch：AI自己跑完285B模型强化学习全流程

> 原标题：DeepSeek研究员开源AutoResearch：AI自主跑通285B模型RL研究闭环

- 来源：AI HOT 精选
- 发布时间：2026-06-19T03:58:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/39354
- 原文：https://x.com/AYi_AInotes/status/2067819352926150953

## 摘要

DeepSeek研究员Deli Chen放出了一个叫AutoResearch的实验协议，让AI智能体在285B参数的模型上独立跑完了一整套强化学习研究闭环——自己设计实验、写代码、提交GPU任务、修bug、写总结，全程没人插手。系统用了GRPO这个工具。不过正文没披露具体做了什么任务、训练了多久、成功率多少，这些关键信息都缺着，所以先别太激动，等有人复...

## 推荐理由

DeepSeek 研究员放出了一个实验协议，让智能体在 285B 模型上独立跑完强化学习研究闭环，设定很强。但正文没披露具体任务、训练时长、成功率这些关键指标，信息缺口太大，所以分数先打个折，等有人复现再说。

## 锐评

Deli Chen放出的AutoResearch，核心卖点是让AI智能体在285B大模型上独立完成强化学习研究的完整闭环——从设计实验、写代码、提交GPU任务、修bug到写总结，全程没人插手。系统用了GRPO这个工具。

但这条消息的信息缺口很大。正文没说是跑什么具体任务，是数学推理还是代码生成？也没说训练了多久、成功率多少、有没有翻车需要人工救场的次数。这些关键指标不公开，就很难判断这套流程到底有多靠谱。

我会先打个折。自主跑通一次和稳定复现是两码事。如果只是挑了一个简单任务、给了充足算力、容忍了多次失败才跑通一次，那离真正的“自主研究”还差得远。等有人复现了、把任务难度和成功率亮出来，再判断这东西的实际价值。
