# FrontierCode 基准给 AI 编程泼了盆冷水：最强模型代码合并通过率只有 13.4%

> 原标题：FrontierCode 基准测试：AI 编程评估新标准--维护者审核通过率最高仅 13.4%

- 来源：AI HOT 精选
- 发布时间：2026-06-09T00:44:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35713
- 原文：https://x.com/AYi_AInotes/status/2064146694774595646

## 摘要

Cognition 搞了个叫 FrontierCode 的编程评测，找了 20 多位资深开源维护者手工出了 150 道题，每道题平均花 40 小时以上，还配了 3000 多条审核规则，核心就一个标准：维护者看完代码愿不愿意合入主分支。他们直接点名 SWE-Bench 这类老评测，说里面超半数通过的代码其实是没法维护的垃圾。结果挺惨淡：Claude Op...

## 推荐理由

HKR 三项都站得住：13.4% 的惨淡通过率是个天然钩子，维护者手工出题和审核的流程给了足够的方法细节，对老评测的批评又正好打在开发者对 AI 代码质量的信任痛点上。不过这是单一团队发布的基准，还没经过社区反复验证，所以分数卡在 78–84 这个区间，不往上拔。

## 锐评

这个评测的狠劲在于把标准从“跑通测试”拉到了“维护者愿不愿意合入”。Cognition 直接点名 SWE-Bench 这类老评测，说里面超半数通过的代码其实是没法维护的垃圾，这话虽然冲，但点到了现有评测的软肋。150 道题，每道平均花 40 小时以上，配了 3000 多条审核规则，投入量级比多数学术评测大得多。

结果挺惨淡：Claude Opus 4.8 在最高难度档拿到 13.4%，GPT-5.5 只有 6.3%，其余模型在 1% 到 5% 之间。这说明即便最强模型，写出来的代码在真实维护场景下九成过不了关。不过要注意，题目和审核规则都是 Cognition 自己组织维护者做的，评测方和被评方没有利益隔离，这点先别太激动。

还缺什么：正文没披露这 20 多位维护者来自哪些项目、有没有利益冲突声明，也没说题目覆盖的语言和框架范围。如果全是特定生态的题，结论的普适性就得打折。另外，维护者“愿不愿意合入”本身有主观成分，3000 多条规则能压住多少主观偏差，也需要更多信息才能判断。
