跳到正文
Latent Space

Cognition 发布 FrontierCode 基准:代码能跑不算完,得看能不能合进主分支

[AINews] FrontierCode: Benchmarking for Code Quality over Slop

Cognition 做了一个叫 FrontierCode 的代码评测,不再只看模型生成的代码能不能通过单元测试,而是直接问“这代码你敢合并吗”。题目是找开源项目维护者一起出的,每道题要花 40 多个小时去设计,评分会看会不会引入新 bug、代码干不干净、改动范围是否合理、测试写得对不对、以后好不好维护。目前最强的模型 Opus 4.8 在最难的那档题目...

推荐理由:Cognition 这个 FrontierCode 评测不再看模型生成的代码能不能跑通测试,而是直接问“你敢合并吗”。题目找开源维护者一起出,每道题设计要 40 多小时,评分维度包括会不会引入新 bug、代码干不干净、改动范围是否合理、测试写得对不对、以后好不好维护。目前最强模型 Opus 4.8 在最难那档题目上表现最好,但正文没披露具体分数和对比细节。评测思路确实补了现有基准的盲区,不过刚出来还没被社区复现验证,78 分合理。

读原文 ↗导出 Markdown