跳到正文
TechCrunch · AI

Anthropic 研究员展示 AI 自己修自己的早期实验:10 项对齐测试全过,整体能力没掉

An Anthropic researcher just gave us a peek at self-improving AI

Anthropic 研究员陈岳翰发了一篇论文,让自动化 AI 系统自己去搜论文、提方法、训练模型,每次训练只跑 30 分钟,反复迭代。给系统 10 个专门测“模型跑偏行为”的基准,它把每一项都修好了,而且没拖累模型的整体表现。管用的方法会被留下,没用的就扔掉,所以这套流程可以一直跑下去。论文标题叫《自动化研究员能可靠缓解对齐失败》。文章把它当成一个早期...

推荐理由:Anthropic 研究员陈岳翰发了一篇论文,让自动化系统自己去搜论文、提方法、训练模型,每次训练只跑 30 分钟,反复迭代。给系统 10 个专门测“模型跑偏行为”的基准,它把每一项都修好了,而且没拖累模型的整体表现。管用的方法会被留下,没用的就扔掉,所以这套流程可以一直跑下去。论文标题叫《自动化研究员能可靠缓解对齐失败》。我会先打个折:正文没披露这套系统在更大规模模型或更复杂任务上的表现,也没说它自己搜到的论文质量到底怎么样,所以目前更像一个早期验证,别直接当成产线方案。但对做对齐的从业者来说,这个方向值得跟——如果模型能自己修自己的毛病,而且每...

读原文 ↗导出 Markdown