# Lilian Weng 谈 AI 装备层工程：让模型自我进化的关键不在模型本身，而在它外面的那层调度系统

> 原标题：Harness Engineering for Self-Improvement：AI装备层设计模式与自改进

- 来源：AI HOT 精选
- 发布时间：2026-07-04T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/42885
- 原文：https://lilianweng.github.io/posts/2026-07-04-harness

## 摘要

Lilian Weng 在这篇长文里把重点从模型权重转移到了“装备层”（harness）——就是包裹在模型外面、负责调度它干活的那套系统。她认为，要让 AI 实现递归式自我改进，光靠模型自己更新参数不够，外面这套负责规划、执行、检查、存东西的软件系统同样重要。文章拆解了三种设计模式：一是让模型按“定目标-执行-观察-改进”的循环自动化跑任务；二是把文件...

## 推荐理由

Weng 把 agent 讨论的重心从模型能力拉回到工程架构上，三种模式对正在搭编程 agent 的团队有直接参考价值。没给 85 以上是因为这算观点文章，不是产品发布或新研究结果，我会先打个折。

## 锐评

这篇长文的核心判断很直接：想让 AI 实现递归式自我改进，不能只盯着模型权重，包裹在模型外面的那层“装备层”同样重要。装备层就是负责调度模型干活的一套软件系统，管着它怎么想、怎么用工具、怎么存东西、怎么检查结果。文章拆了三种设计模式：一是让模型按“定目标-执行-观察-改进”的循环自动化跑任务；二是把文件系统当成模型的长期记忆，比光靠对话窗口靠谱；三是派多个子代理并行干活，再汇总结果。

作者拿 Claude Code 和 Codex 这类编程助手当案例，说明装备层设计得好，能直接拉高产品上限。她还讨论了怎么优化这层，比如调整上下文、用进化算法搜更好的工作流，甚至和模型权重一起联合优化。

不过，正文没给出具体的性能对比数字，也没说这些模式在非编程任务上泛化得怎么样。整篇更像一个框架性梳理，告诉你“这里值得投入”，但离可复现的工程方案还差一步。如果你在做 agent 产品，这篇值得细读；如果指望直接抄作业，那还得自己踩坑。
