# 一份追踪30张模型卡片的排行榜，看前沿实验室到底报告了哪些基准

> 原标题：I checked 30 frontier model cards. Here are the benchmarks labs report

- 来源：Hacker News 首页
- 发布时间：2026-08-16T04:02:38.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/50943
- 原文：https://koutian.is-a.dev/benchmark-radar/?view=leaderboard

## 摘要

这个项目扫了11家机构的30张模型卡片，统计了79个基准被提及的次数，衡量的是厂商的关注度，不是基准本身好不好。MATH-500和Arena-Hard的分数快摸到天花板了，区分力在下降。DeepSeek自家的模型在26天内，AIME涨了40.6分，LiveCodeBench涨了25.4分。有6个基准（包括BrowseComp和SWE-bench Pro...

## 推荐理由

这篇不是评测基准好坏，而是统计厂商关注度，视角本身就有信息量。给出了MATH-500和Arena-Hard接近饱和的具体证据，以及DeepSeek短期内大幅刷分的数字，能引发对基准有效性的讨论。扣分是因为这是个人项目，统计口径和覆盖范围有限，但作为从业者参考够用了。

## 锐评

这个项目扫了11家机构的30张模型卡，统计的是79个基准被提及的次数，本质是厂商关注度排行榜，不是基准质量榜。MATH-500最高分98，Arena-Hard最高95.6，天花板只剩2到4.4分，再拿它们比最强模型已经拉不开差距了。

DeepSeek自家的数据挺扎眼：V3到R1只隔26天，AIME从39.2跳到79.8，LiveCodeBench从40.5跳到65.9。这说明这两个基准当时还有区分空间，但只反映一家厂商的进步速度，别直接套到其他家头上。

有6个基准至少4家机构报了，但正文没披露可读分数，包括BrowseComp和SWE-bench Pro。新基准APEX-Agents已经有3家独立模型卡在报，同样读不到分。信息缺口很明显：知道厂商在关注什么，但不知道他们实际跑成什么样。这点先别太激动。
