跳到正文
r/LocalLLaMA

ProgramBench:让 AI 从零重建大型程序,目前看还不太行

ProgramBench: Can we really rebuild huge binaries from scratch? (doesn't look like it)

这篇帖子介绍了一个新基准 ProgramBench,包含 200 个任务,专门考 AI 智能体能不能只靠一个可执行文件和一份使用说明,就把整个程序从零重新写出来。测试过程不允许联网、不允许反编译,相当于给 AI 一个黑盒子,让它猜里面是怎么实现的。团队花了大概 5 万美元生成了 600 万行行为测试用例,再筛出质量最好的来用,这些测试只看程序的外部行为...

推荐理由:这篇东西我会先打个折:它来自 Reddit,没有其他独立信源交叉验证,所以别当定论看。但它的信息量够硬——ProgramBench 用 200 个任务、约 5 万美元生成了 600 万行黑盒测试,让 Agent 只看可执行文件和说明文档去重建程序,还不准联网、不准反编译。结果就是 Agent 基本搞不定,这直接质疑了现在编程 Agent 评测(比如 SWE-bench)到底测的是真本事还是背题库。对从业者来说,这提醒我们别被榜单分数带偏,实际让模型进业务流程干活之前,得先看看它在“闭卷、无网、大工程”这种真实约束下会不会翻车。

读原文 ↗导出 Markdown