# 斯坦福论文：让 AI 自己写外挂代码，Meta-Harness 用完整历史记录教 coding agent 迭代优化

> 原标题：Meta-Harness | Harness工程代码能自我迭代吗 | 斯坦福论文 | 文本优化方法的缺陷 | coding agent | 提议器 | 搜索循环 | 局限性 | 交给AI

- 来源：最佳拍档
- 发布时间：2026-04-13T23:00:58.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/2783
- 原文：https://www.youtube.com/watch?v=nkPAS2hTqmw

## 摘要

斯坦福、MIT 和 KRAFTON AI 搞了个叫 Meta-Harness 的系统，核心想法很简单：别让工程师手动调那层包裹在大模型外面的代码逻辑（harness），而是把这件事变成一个搜索问题，交给 coding agent 自己去翻历史记录、自己改代码。它跟现有文本优化方法最大的区别是不压缩反馈信息，所有候选代码、完整执行日志和评分都摊在文件系统...

## 推荐理由

这篇把 harness 优化从人工调参改成外循环搜索，让 coding agent 读文件历史、跑代码、看日志，不压缩反馈。我会先打个折，因为来源是 YouTube 解读而非原论文，但给出的数字够具体：TerminalBench-2 跑 20 轮要几百美元，在线文本分类 4 轮就顶别人 60 轮的效果。对做 agent 工程的人，这个思路比单纯改 prompt 更解渴，所以放在 featured 档。

## 锐评

这篇论文的核心思路很直接：别让工程师手动调那层包裹在大模型外面的代码逻辑（harness），而是把这件事变成一个搜索问题，交给 coding agent 自己去翻历史记录、自己改代码。它跟现有文本优化方法最大的区别是不压缩反馈信息，所有候选代码、完整执行日志和评分都摊在文件系统里，让 agent 按需查看。在在线文本分类任务上，Meta-Harness 用 4 次搜索迭代就追平了 OPRO 方法 60 次迭代的精度，5 个分布外数据集平均精度达到 75.9%，比之前最好的 ACE 方法高出 7.7 个百分点。在 TerminalBench-2 的编程任务上，它甚至超过了工程师手动调试出来的 Agent，成为同模型下排名第一的方案。

不过，这个系统的成本不低。在 TerminalBench-2 上跑了约 20 次搜索迭代，总花费大概几百美元，主要是 API 调用费。对于资源有限的小团队来说，这仍然是个门槛。另外，它的效果高度依赖 coding agent 本身的能力，如果提议器不够强，搜索质量会明显下降。还有一个关键限制：它假设存在一个清晰、可量化的评估函数，但在很多实际应用场景里，这种客观指标并不好定义。

论文没披露的是，这套方法在更复杂的多步推理或需要主观评价的任务上表现如何，以及当搜索空间进一步扩大时，文件系统存储的方式会不会成为新的瓶颈。不过它给出的启示很实用：与其花精力设计怎么压缩信息喂给 agent，不如把完整的历史数据都给它，让它自己决定看什么。
