# ProgramBench：让 AI 从零重建大型程序，目前看还不太行

> 原标题：ProgramBench: Can we really rebuild huge binaries from scratch? (doesn't look like it)

- 来源：r/LocalLLaMA
- 发布时间：2026-05-05T15:40:52.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/14429
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1t4j4s9/programbench_can_we_really_rebuild_huge_binaries/

## 摘要

这篇帖子介绍了一个新基准 ProgramBench，包含 200 个任务，专门考 AI 智能体能不能只靠一个可执行文件和一份使用说明，就把整个程序从零重新写出来。测试过程不允许联网、不允许反编译，相当于给 AI 一个黑盒子，让它猜里面是怎么实现的。团队花了大概 5 万美元生成了 600 万行行为测试用例，再筛出质量最好的来用，这些测试只看程序的外部行为...

## 推荐理由

这篇东西我会先打个折：它来自 Reddit，没有其他独立信源交叉验证，所以别当定论看。但它的信息量够硬——ProgramBench 用 200 个任务、约 5 万美元生成了 600 万行黑盒测试，让 Agent 只看可执行文件和说明文档去重建程序，还不准联网、不准反编译。结果就是 Agent 基本搞不定，这直接质疑了现在编程 Agent 评测（比如 SWE-bench）到底测的是真本事还是背题库。对从业者来说，这提醒我们别被榜单分数带偏，实际让模型进业务流程干活之前，得先看看它在“闭卷、无网、大工程”这种真实约束下会不会翻车。

## 锐评

ProgramBench 这个新基准挺狠的：给 AI 一个黑盒可执行文件和一份说明，让它从零把整个程序重写出来，不许联网、不许反编译。团队花了大概 5 万美元生成了 600 万行行为测试用例，再筛出质量最好的来用，这些测试只看程序的外部行为，不限制 AI 用什么语言实现。

目前公布的结果里只有闭源模型，开源模型表现更差，作者解释是开源模型在 SWE-bench 这类老基准上过拟合了，碰到新题就露馅。这个判断有道理，但正文没披露具体通过率或得分，也没说 200 个任务的难度分布，所以“搞不定”到底有多惨还不清楚。

另外，5 万美元的测试生成成本不低，但没说明这钱主要花在哪、有没有更省的办法。整个基准的设定挺有意思，相当于逼模型做“逆向工程式开发”，比改 bug 或补代码难得多。等开源模型的结果和社区提交开放后，才能看清这到底是模型能力的天花板，还是基准设计本身太苛刻。
