# 自我改进 AI：一个被压扁的二维场

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-08-29T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/53655
- 原文：https://yage.ai/share/self-improving-ai-2d-field-20260829.html

## 摘要

2026年上半年，自我改进AI从实验室术语变成了融资热词，但各家系统做的事差得很远。Karpathy开源的autoresearch只动一个train.py文件，靠5分钟微型训练跑出的压缩指标驱动，一夜能试100次。Weco的AIDE²改的是智能体的运行脚手架，在8天无人值守的测试里跑赢了人类工程师调了2年的基线。拿了6.5亿美元融资的RSI则横跨训练脚...

## 推荐理由

这篇不是一手发布，是行业评论，但信息密度高，把“自我改进 AI”这个被融资吹胀的词压回工程现实。文章只给了框架预览，完整矩阵没展开，所以分数没给更高。

## 锐评

这篇文章做了一件融资新闻不会做的事：把“自我改进AI”这个热词拆开看。作者用两个维度——改什么（权重、代码、脚手架、评估器）和靠什么信号验证（形式化验证、执行反馈、自评等）——把Karpathy的autoresearch、Weco的AIDE²、RSI的系统、OpenAI的Sol、Anthropic的内部实验等七八个项目摆在一起，发现它们做的事差得很远。Karpathy只动一个train.py，靠5分钟微型训练的val_bpb指标驱动，一夜跑100次实验；Weco改的是智能体的运行脚手架，8天无人值守跑赢了人类工程师调了2年的基线；RSI横跨训练脚本和GPU kernel，约200行代码改动，在NanoGPT上把训练耗时从79.7秒压到77.5秒。Anthropic说80%合入代码库的代码由Claude写，但特意注明微型实验的52倍加速不能外推。

文章引用的1250篇论文综述指出，真正的瓶颈是验证信号强度。形式化验证器最强，自评最弱且容易被污染。作者据此画出一个二维场，发现代码优化区挤满了玩家，而开放式科研区几乎是空的。这个判断有数据支撑，但文章本身没给出完整的矩阵图，只描述了坐标轴和几个点的位置。另外，RSI拿了6.5亿美元融资，但公开的技术细节只有3项基准测试和约200行代码改动的案例，离“递归自我改进”的叙事还有距离。Weco的8天实验虽然跑赢了人类基线，但测试环境是标准基准，迁移到真实业务的效果没披露。
