跳到正文
Computing Life · Share · 鸭哥调研

BackendForge 让 AI 编程评测从笔试变面试,同一份代码通过率直接腰斩

BackendForge:AI 已经能写完整 App,评测也得学会追问

BackendForge 先给 56 个后端任务写了 7,250 项测试,再让 Agent 专门找这套题库漏了什么,最后补了 640 项。测试只多了 8.8%,但 GPT-5.5 全部通过的任务从 31 个掉到 16 个,Claude Opus 4.7 从 33 个掉到 10 个。代码没变,变的是评分方式:新题专挑权限、脏数据、连带影响这些第一版没覆盖...

推荐理由:BackendForge 这件事有意思在它不拼模型,拼的是出题方式。先拿 56 个后端任务写了 7,250 项测试,再让 Agent 自己找题库的盲区,补了 640 项。测试量只涨了 8.8%,但 GPT-5.5 和 Claude Opus 4.7 的满分率直接腰斩。代码没变,变的是评分标准——新题专挑权限、脏数据、连带影响这些第一版没覆盖的角落。这对做 AI 编码工具的人是个实在提醒:模型能跑通任务不代表真靠谱,评测得学会追问。数字清晰,结论有冲击力,而且没吹模型,吹的是方法论,值得放 featured。

读原文 ↗导出 Markdown