编程智能体内部会提前“脑补”未来 25 步的代码修改
Coding agents think ahead of time
这篇论文发现,编程智能体里的语言模型,其内部隐藏状态能线性编码当前代码的各种状态——比如能不能解析通过、能不能跑通测试、有没有减少失败用例、有没有引入新 bug。用逻辑回归探针去读这些隐藏状态,判断代码正确性的 AUC 最高能到 0.83。更让人意外的是,模型对还没发生的修改已经有了“预感”:探针能提前大约 25 步就预测出未来编辑的结果,作者管这叫“...
推荐理由:这篇论文拿线性探针去读编程 agent 内部状态,发现模型对代码能不能跑通、有没有 bug 这些事,脑子里其实有数——AUC 能到 0.83。更意外的是,模型对还没发生的修改已经有预判,提前大约 25 步就能看出未来编辑的走向。我会先打个折:这是纯学术研究,没给工具或产品路线,所以实用性还谈不上。但“提前预感”这个点本身挺有意思,给可解释性研究提供了一个量化的锚。