这篇文章做了一件融资新闻不会做的事:把“自我改进AI”这个热词拆开看。作者用两个维度——改什么(权重、代码、脚手架、评估器)和靠什么信号验证(形式化验证、执行反馈、自评等)——把Karpathy的autoresearch、Weco的AIDE²、RSI的系统、OpenAI的Sol、Anthropic的内部实验等七八个项目摆在一起,发现它们做的事差得很远。Karpathy只动一个train.py,靠5分钟微型训练的val_bpb指标驱动,一夜跑100次实验;Weco改的是智能体的运行脚手架,8天无人值守跑赢了人类工程师调了2年的基线;RSI横跨训练脚本和GPU kernel,约200行代码改动,在NanoGPT上把训练耗时从79.7秒压到77.5秒。Anthropic说80%合入代码库的代码由Claude写,但特意注明微型实验的52倍加速不能外推。
文章引用的1250篇论文综述指出,真正的瓶颈是验证信号强度。形式化验证器最强,自评最弱且容易被污染。作者据此画出一个二维场,发现代码优化区挤满了玩家,而开放式科研区几乎是空的。这个判断有数据支撑,但文章本身没给出完整的矩阵图,只描述了坐标轴和几个点的位置。另外,RSI拿了6.5亿美元融资,但公开的技术细节只有3项基准测试和约200行代码改动的案例,离“递归自我改进”的叙事还有距离。Weco的8天实验虽然跑赢了人类基线,但测试环境是标准基准,迁移到真实业务的效果没披露。