# 模型不是笨，是 Harness 没配好

> 原标题：推荐阅读若石写的这篇博客：模型不是笨，是 Harness 没配好

- 来源：X · @dotey（宝玉）
- 发布时间：2026-04-16T06:14:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/3508
- 原文：https://x.com/dotey/status/2044660793153655205

## 摘要

若石的博客把多步智能体跑崩的锅从模型身上拿开，扣在了工程约束没跟上。文章提出 Harness Engineering 四个原则：能用代码约束就别靠模型自觉，比如 JSON 输出直接上 Schema 校验，非法就回炉；关键状态外置到 state.json，崩了重启还能接着跑；验收必须交给独立的 Evaluator 模型或真执行一下，别让模型自评；失败要局...

## 推荐理由

这篇是转述若石的博客，没有披露成功率提升的具体数字，我会先打个折。但它的判断很直接：agent 多步任务老翻车，问题出在 Harness 没配好，不是模型不行。给出的 70% 上下文阈值、日志压缩、状态外置和 Schema 重试都是可落地的工程动作，对正在调 agent 的人有参考价值。

## 锐评

若石这篇文章的核心判断我认同：多步智能体翻车，往往不是模型笨，是外围工程没跟上。他把这层工作叫 Harness Engineering，说白了就是给模型上安全带——用代码约束代替提示词苦劝、把运行状态外置到文件、验收交给独立裁判、失败只重试局部不连坐全局。这四个原则对正在落地 agent 的团队有直接参考价值。

文章举的例子很具体：上下文占用超 70% 后模型开始跳步骤、自评把烂代码夸成"结构清晰"、日志从 32K token 压缩到 7K 不掉关键信息。这些坑我都见过，所以可信度不低。但要注意，全文是经验总结而非对照实验，没给出加 harness 前后的成功率对比数字，也没说明 evaluator 模型本身会不会误判。

最小落地版本提得务实：一个 state.json、工具调用的指数退避重试、Schema 校验、统一截断工具返回。如果团队刚开始做 agent，这四个先上，比继续调 prompt 收益大。还缺的是：不同模型对 harness 约束的敏感度差异、多 agent 协作时的状态共享方案、以及长期运行下 state.json 本身会不会膨胀到需要二次治理。
