# BackendForge 让 AI 编程评测从笔试变面试，同一份代码通过率直接腰斩

> 原标题：BackendForge：AI 已经能写完整 App，评测也得学会追问

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-07-17T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/45072
- 原文：https://yage.ai/share/backendforge-adaptive-benchmark-20260717.html

## 摘要

BackendForge 先给 56 个后端任务写了 7,250 项测试，再让 Agent 专门找这套题库漏了什么，最后补了 640 项。测试只多了 8.8%，但 GPT-5.5 全部通过的任务从 31 个掉到 16 个，Claude Opus 4.7 从 33 个掉到 10 个。代码没变，变的是评分方式：新题专挑权限、脏数据、连带影响这些第一版没覆盖...

## 推荐理由

BackendForge 这件事有意思在它不拼模型，拼的是出题方式。先拿 56 个后端任务写了 7,250 项测试，再让 Agent 自己找题库的盲区，补了 640 项。测试量只涨了 8.8%，但 GPT-5.5 和 Claude Opus 4.7 的满分率直接腰斩。代码没变，变的是评分标准——新题专挑权限、脏数据、连带影响这些第一版没覆盖的角落。这对做 AI 编码工具的人是个实在提醒：模型能跑通任务不代表真靠谱，评测得学会追问。数字清晰，结论有冲击力，而且没吹模型，吹的是方法论，值得放 featured。

## 锐评

这条新闻最值得看的是评测思路的转变，而不是具体分数。BackendForge 先写好 7,250 项测试，再让 Agent 围着参考服务找漏，补了 640 项新题。新题数量不多，但专挑第一版没覆盖的权限、脏数据和连带影响。同一批代码，GPT-5.5 全过的任务从 31 个掉到 16 个，Claude Opus 4.7 从 33 个掉到 10 个。这说明以前很多“全过”的成绩，可能只是题目没问到点上。

不过得打两个折。第一，论文说会公开材料，但截至发稿还没放出来，外界没法逐项检查那 640 项新题是否合理。第二，这套追问是按每个 task 的参考服务定制的，不同 task 补的题不一样，所以不能把“通过率腰斩”直接套到其他评测上。

真正可复用的思路是：以后做整套应用评测，可以在定稿前加一轮面试式追问，让 Agent 先对着参考服务找漏，人再检查新题有没有需求依据，最后冻结成统一题库。这样既保持公平比较，又不漏掉关键边界情况。
