# 同一个工具开关，一个模型赚了，一个崩了：编程智能体外层设计的关键决策

> 原标题：harness 设计的关键决策：同一个开关，一个模型赚了，一个崩了

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-09-23T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/58613
- 原文：https://yage.ai/share/harness-design-decisions-20260923.html

## 摘要

一项新研究把编程智能体的外层控制软件拆成了任务规划、上下文管理和动作接口三个独立开关，挨个测试。最扎眼的结果是：把预设的文件读写工具全撤掉、换成纯命令行后，Nemotron-3 550B 在代码修复任务上的成功率涨了 3.6 个百分点，单任务估算成本从 2.33 美元砍到 1.11 美元；但 Mistral-Medium-3.5-128B 的成功率却从...

## 推荐理由

这篇论文做了一个很干净的对照实验：把智能体的外层控制软件拆成任务规划、上下文管理和动作接口三个开关，单独拧动看效果。最反直觉的发现是，把预设的文件读写工具全撤掉、换成纯命令行后，Nemotron-3 550B 在代码修复任务上成功率涨了 3.6 个百分点，单任务成本从 2.33 美元砍到 1.11 美元；但 Mistral-Medium-3.5-128B 的成功率却直接掉了一截。这种同一开关、两个模型走向完全相反的结果，比单纯刷榜有信息量得多。正文没披露实验的统计显著性检验，这点先别太激动，但成本数字和成功率变化幅度已经足够让做工程的人重新审视自己...

## 锐评

这篇论文把编程智能体的外层控制软件拆成规划、上下文管理和动作接口三个独立开关，挨个测了一遍。最反直觉的发现是：把预设的文件读写工具全撤掉、换成纯命令行后，Nemotron-3 550B 在代码修复任务上成功率涨了 3.6 个百分点，单任务估算成本从 2.33 美元砍到 1.11 美元；但 Mistral-Medium-3.5-128B 的成功率却从 68.60% 跌到 45.40%。轨迹分析显示，550B 能自己把查找、匹配、替换编成紧凑的 shell 单行命令，编辑效率反而更高；Mistral 没了专用工具后，32.80% 的任务直接找不到文件就退出了。

任务规划这个开关也很有意思。对 30B 的小模型，开规划是救命绳，成功率从 13.60% 跳到 25.20%；但对 550B 和 Mistral 这种大模型，开规划没提分，主要作用是省钱——550B 成本降了约 30%，因为规划管住了它做完改动后没完没了复核的毛病。上下文管理在 128k 窗口下收益已经很小，成功率差距只剩 2.7 个百分点，那些复杂的读回机制几乎没被调用过。

研究覆盖了 176 种实验配置，但正文没披露所有模型在 Terminal-Bench 上的统计显著性检验细节，89 题的样本量让那几项提升还站不太稳。另外，纯命令行模式其实不是真的只剩终端指令，规划开启时仍保留了计划更新和历史读回工具，这点在对比时要留意。
