# Dirac 这个开源编程助手在 TerminalBench 上拿了第一，靠的是省 token 和并行操作

> 原标题：Show HN: OSS Agent I built topped the TerminalBench on Gemini-3-flash-preview

- 来源：Hacker News 首页
- 发布时间：2026-04-27T12:35:55.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/10449
- 原文：https://github.com/dirac-run/dirac

## 摘要

Dirac 是一个专门抠上下文效率的编程助手，刚在 TerminalBench 上跑分拿了第一，用的模型是 Gemini-3-flash-preview。它说自己能把 API 调用成本压到其他同类工具的 20% 到 50%，主要靠三招：用哈希锚点来精准定位代码修改位置、把能并行的操作全并行跑、直接操作抽象语法树而不是整段重写。不过正文没披露 Termi...

## 推荐理由

HKR 三项都站得住：一个开源编程智能体声称在 TerminalBench 上拿了第一，还给出了具体模型和成本降幅，技术细节也没藏着。不过分数我压到 78，因为目前只有仓库自述，完整榜单分数和复现日志都没放出来，先别太激动。

## 锐评

Dirac 这个项目最实在的一点是它把省钱逻辑讲清楚了：用哈希锚点定位代码改动位置，而不是把整个文件扔给模型；能并行的操作全并行跑，减少等待轮次；直接改抽象语法树，避免整段重写。这三招合起来，声称能把 API 调用成本压到同类工具的 20% 到 50%。

不过得打个折。正文只说了“在 TerminalBench 上拿第一”，没披露具体分数、跟哪些工具比、测试集多大。TerminalBench 本身也不是一个被广泛引用的基准，它的题目难度和覆盖面还不清楚。另外，成本对比的基线是谁？是跟 Claude Code 比还是跟开源小工具比，差距会很大。

还缺一个关键信息：省了 API 钱，代码质量到底怎么样。项目说“同时提升代码质量”，但没有给出任何通过率、正确率或人工评估的数据。如果只是生成得快且便宜但改错率高，那省下来的钱可能得花在 debug 上。建议等有独立评测或更完整的对比报告出来再判断。
