AI 编程助手的胜负手不在模型,而在你给它搭的“脚手架”
Agent Harness Engineering
Addy Osmani 提出一个反常识的观点:一个编程 AI 好不好用,模型本身只占一半,另一半取决于你给它搭建的“脚手架”(Harness)——包括提示词、工具、沙盒、钩子和反馈循环。一个中等模型配上好脚手架,能干翻一个顶尖模型配上烂脚手架。最直接的证据是,Claude Opus 4.6 在 Terminal Bench 2.0 测试里,仅仅因为换了...
推荐理由:Addy Osmani 这篇把“Agent Harness Engineering”拎出来讲,核心就一个数据点:Claude Opus 4.6 在 Terminal Bench 2.0 上,只换脚手架就从 28% 飙到 72%。这个观点不算全新,但把散装的工程实践系统化命名,对正在搭 AI 编程工具的团队有直接参考价值。我会先打个折——正文没披露脚手架具体改了什么、测试集多大、有没有重复实验,所以 72% 这个数先别太激动。但方向是对的,值得放进精选。