SWE-Bench 作者出新基准 ProgramBench,Claude、GPT、Gemini 全拿零蛋
这个新基准让模型从零复刻完整软件项目,只给可执行文件和说明文档,不给源码和测试。评测不看单函数写得对不对,而是用模糊测试跑行为一致性,看整个系统能不能用。结果 Claude Opus 4.7、GPT-5.4、Gemini 3.1 Pro 全部零完成率,一个都没跑通。这说明现在的模型离独立做系统工程还差得远,之前靠刷单函数题拿高分那套在这不管用。
推荐理由:我会先打个折:这只是单个基准测试报告,不是模型或产品发布。但 0% 的完成率太刺眼,而且测试设计很刁——只给可执行文件和说明文档,让模型从零重建项目,再用行为等价和 agent-driven fuzzing 判分。正文没披露样本量和任务难度分布,这点先别太激动。真正值得盯的是它把评测从函数级代码生成拉到了系统级工程能力,这对做 coding agent 的团队是个实打实的压力测试。