# SWE-Bench 作者出新基准 ProgramBench，Claude、GPT、Gemini 全拿零蛋

> 原标题：0%完成率！Claude、GPT、Gemini 全灭，SWE-Bench作者新作把AI圈干沉默了

- 来源：机器之心 · 公众号
- 发布时间：2026-05-07T02:05:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/15743
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651031726&idx=2&sn=105ca19f31b4709f958795a3a73bc0ca

## 摘要

这个新基准让模型从零复刻完整软件项目，只给可执行文件和说明文档，不给源码和测试。评测不看单函数写得对不对，而是用模糊测试跑行为一致性，看整个系统能不能用。结果 Claude Opus 4.7、GPT-5.4、Gemini 3.1 Pro 全部零完成率，一个都没跑通。这说明现在的模型离独立做系统工程还差得远，之前靠刷单函数题拿高分那套在这不管用。

## 推荐理由

我会先打个折：这只是单个基准测试报告，不是模型或产品发布。但 0% 的完成率太刺眼，而且测试设计很刁——只给可执行文件和说明文档，让模型从零重建项目，再用行为等价和 agent-driven fuzzing 判分。正文没披露样本量和任务难度分布，这点先别太激动。真正值得盯的是它把评测从函数级代码生成拉到了系统级工程能力，这对做 coding agent 的团队是个实打实的压力测试。

## 锐评

这个结果挺狠的。ProgramBench 让模型只看可执行文件和使用说明，就把整个软件项目复刻出来，最后用模糊测试跑行为一致性——不是看某段代码写得对不对，而是看整个系统能不能用。Claude Opus 4.7、GPT-5.4、Gemini 3.1 Pro 全部零完成率，说明现在的模型离独立做系统工程还差得远。之前靠刷单函数题拿高分那套，在这种需要理解整体架构、处理隐式约束的任务上完全失效。

这个基准来自 SWE-Bench 的作者团队，设计思路就是反刷题：不给源码、不给测试，只给最终产物和文档，逼模型自己推断内部逻辑。评测方式也换了，用 agent 驱动的模糊测试去撞行为差异，比跑固定测试用例更接近真实验收。

不过正文没披露样本数量和项目复杂度分布，也没说模型是在什么条件下跑的——给了多少轮尝试、有没有人工介入。零完成率本身很震撼，但如果样本只有个位数，或者项目都是大型系统级工程，那这个数字的普适性就得打个折。另外，模型在部分子任务上的表现也没提，是全流程崩在第一步，还是卡在某个特定环节，这些信息对判断瓶颈在哪很关键。
