# AI 编程助手的胜负手不在模型，而在你给它搭的“脚手架”

> 原标题：Agent Harness Engineering

- 来源：Hacker News 首页
- 发布时间：2026-07-12T14:16:31.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/43925
- 原文：https://addyosmani.com/blog/agent-harness-engineering/

## 摘要

Addy Osmani 提出一个反常识的观点：一个编程 AI 好不好用，模型本身只占一半，另一半取决于你给它搭建的“脚手架”（Harness）——包括提示词、工具、沙盒、钩子和反馈循环。一个中等模型配上好脚手架，能干翻一个顶尖模型配上烂脚手架。最直接的证据是，Claude Opus 4.6 在 Terminal Bench 2.0 测试里，仅仅因为换了...

## 推荐理由

Addy Osmani 这篇把“Agent Harness Engineering”拎出来讲，核心就一个数据点：Claude Opus 4.6 在 Terminal Bench 2.0 上，只换脚手架就从 28% 飙到 72%。这个观点不算全新，但把散装的工程实践系统化命名，对正在搭 AI 编程工具的团队有直接参考价值。我会先打个折——正文没披露脚手架具体改了什么、测试集多大、有没有重复实验，所以 72% 这个数先别太激动。但方向是对的，值得放进精选。

## 锐评

Addy Osmani 这篇文章把“脚手架工程”这个概念讲得很透。核心观点是：我们花了太多时间争论哪个模型更强，却忽略了让模型真正干活的那套外围系统——提示词、工具、沙盒、钩子和反馈循环。一个很直观的证据是，Claude Opus 4.6 在 Terminal Bench 2.0 测试里，仅仅因为换了一套定制的脚手架，排名就从 Top 30 冲到了 Top 5。这说明模型的能力被原装脚手架封印了，换个更好的“外挂”就能解锁。

文章里最实用的思想是“棘轮机制”：每次 AI 犯错，你就把它变成一个永久性的规则或检查项，写进 AGENTS.md 或前置钩子里，确保它不会再犯第二次。这比干等下一个更聪明的模型版本要实际得多。

不过，文章主要基于个人经验和几个团队的案例，没有提供大规模、跨项目的量化对比数据。脚手架到底能提升多少效率、在不同类型的代码任务上表现是否稳定，这些还缺少系统性的验证。如果是真的，那对团队来说，把精力从选模型转向打磨脚手架，可能是当下最省钱也最见效的策略。
