# Cognition 发布 FrontierCode 基准：代码能跑不算完，得看能不能合进主分支

> 原标题：[AINews] FrontierCode: Benchmarking for Code Quality over Slop

- 来源：Latent Space
- 发布时间：2026-06-09T06:12:33.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38347
- 原文：https://www.latent.space/p/ainews-frontiercode-benchmarking

## 摘要

Cognition 做了一个叫 FrontierCode 的代码评测，不再只看模型生成的代码能不能通过单元测试，而是直接问“这代码你敢合并吗”。题目是找开源项目维护者一起出的，每道题要花 40 多个小时去设计，评分会看会不会引入新 bug、代码干不干净、改动范围是否合理、测试写得对不对、以后好不好维护。目前最强的模型 Opus 4.8 在最难的那档题目...

## 推荐理由

Cognition 这个 FrontierCode 评测不再看模型生成的代码能不能跑通测试，而是直接问“你敢合并吗”。题目找开源维护者一起出，每道题设计要 40 多小时，评分维度包括会不会引入新 bug、代码干不干净、改动范围是否合理、测试写得对不对、以后好不好维护。目前最强模型 Opus 4.8 在最难那档题目上表现最好，但正文没披露具体分数和对比细节。评测思路确实补了现有基准的盲区，不过刚出来还没被社区复现验证，78 分合理。

## 锐评

这条新闻最值得看的是评测思路的转变。过去像 SWE-Bench 这类基准，主要看模型生成的代码能不能通过单元测试，但 METR 发现很多能通过测试的 PR 其实根本合不进主分支。FrontierCode 直接对着这个假阳性问题开刀，评分维度包括会不会引入新 bug、代码干不干净、改动范围是否合理、测试写得对不对、以后好不好维护。题目是找开源项目维护者一起出的，每道题要花 40 多个小时设计，成本不低，但确实更贴近真实开发场景。

目前最强的模型 Opus 4.8 在最难那档题目上只拿到约 13%，而传统基准上动辄 50% 以上。这个差距说明以前很多“高分”模型写出来的其实是能跑但没法用的代码。不过正文没披露样本量和题目总数，也没说评分者之间的一致性如何，这些会直接影响结论的可靠性。另外，评测只覆盖了开源维护者出题的那类任务，能不能代表更广泛的工程场景还不好说。

整体看，这个基准把“代码质量”从口号变成了可量化的指标，对做代码 agent 的团队是个有用的信号。但分数低不代表模型不行，也可能只是评测太难，这点先别太激动。
