# TACO 让命令行 Agent 自己学会扔掉没用的上下文

> 原标题：TACO: 让 CLI Agent 在自主迭代中学会丢掉无用上下文

- 来源：机器之心 · 公众号
- 发布时间：2026-05-07T02:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15744
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651031726&idx=3&sn=43bc79f6487a4bbfb12e9b76ada48d52

## 摘要

TACO 是一套不用额外训练的命令行输出压缩方法，让模型在执行任务时自己发现哪些终端回显是废话、哪些必须保留。它在 TerminalBench 1.0 和 2.0 上同时提升了任务成功率和 token 利用率，并发现 TerminalBench 2.0 的原始提示里有 24.6% 到 44.1% 的低价值冗余。核心机制是“任务内进化规则 + 全局规则池...

## 推荐理由

这篇论文解决的是终端 agent 上下文越跑越臃肿的老问题，方法很轻量——任务里生成纠偏规则，再存进全局规则池复用。TerminalBench 上的成功率提升和 token 效率改善都有数据支撑，24.6%–44.1% 的冗余比例和 >90% 的规则留存率是两个值得盯的指标。没有新模型或产品发布，属于扎实的 agent 工程研究，放在 featured 档合适。

## 锐评

这条研究解决了一个很实际的问题：命令行 agent 干活时，终端返回的信息经常又长又乱，模型容易被无效内容带偏，还白烧 token。TACO 的思路是让模型在执行任务的过程中自己总结哪些输出该留、哪些该扔，形成压缩规则，再把这些规则存进一个全局池子里复用。不用微调模型，纯靠提示词工程。

在 TerminalBench 1.0 和 2.0 上，任务成功率和 token 利用率都上去了。他们还顺手测出 TerminalBench 2.0 的原始提示里有 24.6% 到 44.1% 的低价值冗余，这个数字挺说明问题——很多 benchmark 本身就不够干净。另外，经过多轮进化后，排名前 30 的规则保留率超过 90%，说明这套规则生成机制比较稳定，不是随机撞大运。

不过正文没披露具体用了哪些模型做测试，也没说规则进化对推理延迟的影响有多大。如果规则池越滚越大，检索和匹配的成本会不会吃掉省下来的 token 收益，这点还需要看后续验证。
