跳到正文
Hacker News 首页

一份追踪30张模型卡片的排行榜,看前沿实验室到底报告了哪些基准

I checked 30 frontier model cards. Here are the benchmarks labs report

这个项目扫了11家机构的30张模型卡片,统计了79个基准被提及的次数,衡量的是厂商的关注度,不是基准本身好不好。MATH-500和Arena-Hard的分数快摸到天花板了,区分力在下降。DeepSeek自家的模型在26天内,AIME涨了40.6分,LiveCodeBench涨了25.4分。有6个基准(包括BrowseComp和SWE-bench Pro...

推荐理由:这篇不是评测基准好坏,而是统计厂商关注度,视角本身就有信息量。给出了MATH-500和Arena-Hard接近饱和的具体证据,以及DeepSeek短期内大幅刷分的数字,能引发对基准有效性的讨论。扣分是因为这是个人项目,统计口径和覆盖范围有限,但作为从业者参考够用了。

读原文 ↗导出 Markdown