# Anthropic 研究员展示 AI 自己修自己的早期实验：10 项对齐测试全过，整体能力没掉

> 原标题：An Anthropic researcher just gave us a peek at self-improving AI

- 来源：TechCrunch · AI
- 发布时间：2026-08-28T19:30:38.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53510
- 原文：https://techcrunch.com/2026/08/28/an-anthropic-researcher-just-gave-us-a-peek-at-self-improving-ai/

## 摘要

Anthropic 研究员陈岳翰发了一篇论文，让自动化 AI 系统自己去搜论文、提方法、训练模型，每次训练只跑 30 分钟，反复迭代。给系统 10 个专门测“模型跑偏行为”的基准，它把每一项都修好了，而且没拖累模型的整体表现。管用的方法会被留下，没用的就扔掉，所以这套流程可以一直跑下去。论文标题叫《自动化研究员能可靠缓解对齐失败》。文章把它当成一个早期...

## 推荐理由

Anthropic 研究员陈岳翰发了一篇论文，让自动化系统自己去搜论文、提方法、训练模型，每次训练只跑 30 分钟，反复迭代。给系统 10 个专门测“模型跑偏行为”的基准，它把每一项都修好了，而且没拖累模型的整体表现。管用的方法会被留下，没用的就扔掉，所以这套流程可以一直跑下去。论文标题叫《自动化研究员能可靠缓解对齐失败》。我会先打个折：正文没披露这套系统在更大规模模型或更复杂任务上的表现，也没说它自己搜到的论文质量到底怎么样，所以目前更像一个早期验证，别直接当成产线方案。但对做对齐的从业者来说，这个方向值得跟——如果模型能自己修自己的毛病，而且每...

## 锐评

这篇论文展示了一个让 AI 自己修自己的流程：系统自动读论文、提改进方法、训练模型，每次训练只花 30 分钟，然后看效果。管用的方法留下，没用的扔掉，再进入下一轮。在 10 个专门测模型“跑偏行为”的基准上，这套流程把每一项都修好了，而且没拖累模型的整体表现。

先别太激动。文章没提实验用的是多大的模型，也没说这 10 个基准具体测什么、难度如何。30 分钟的训练时长听起来很短，但这也意味着每次迭代能验证的改动量有限。另外，这套流程目前只在“对齐失败”这个特定问题上跑通了，离通用的自我改进还差得远。

最关键的缺口是：正文没披露这套系统有没有产生过什么意外行为，也没说离实际产品落地还有多远。它更像一个早期概念验证，证明自动化对齐研究这条路能走，但能不能规模化、成本多高，都还是未知数。
