# AGI Ranker 修正了评分天花板逻辑，所有模型分数掉了 6 到 15 分

> 原标题：Show HN: I audited my AI leaderboard scale – every score dropped 6-15 points

- 来源：Hacker News 首页
- 发布时间：2026-07-30T14:04:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47634
- 原文：https://agiranker.com/

## 摘要

AGI Ranker 把 10 个公开基准测试打包成一个 0 到 100 的综合分，100 分代表摸到 AGI 门槛。最近他们做了一次审计，发现之前把几乎所有基准的满分都当成了“人类顶尖水平”，但真正有公开发表的人类对照实验的只有 GPQA Diamond 这一个（人类得分 0.81）。其余九个基准的“天花板”其实只是卷面满分，不等于人类水平。修正这个...

## 推荐理由

AGI Ranker 自己动手查了自己的评分逻辑，发现 10 个基准里 9 个的“人类顶尖水平”其实只是卷面满分，没有公开发表的人类对照实验支撑。修正后所有模型综合分掉了 6 到 15 分，等于之前的分都虚高了。这件事对做评估的人是个直接提醒：排行榜上的人类基线不能默认信，得看有没有实测数据。我会先打个折，因为这是方法修正而不是新发现，但透明度和具体数字让它值得上推荐。

## 锐评

AGI Ranker 这个榜单把 10 个公开基准打包成一个 0-100 的综合分，100 分代表摸到 AGI 门槛。他们最近做了一次审计，发现一个挺要命的设定错误：之前几乎把所有基准的满分都当成了“人类顶尖水平”。但真正有公开发表的人类对照实验的，只有 GPQA Diamond 这一个，人类得分是 0.81。其余九个基准的“天花板”其实只是卷面满分，不等于人类水平。修正这个错误后，所有模型的分数都掉了 6 到 15 分。现在这个分数变成了一个混合标尺，不再能直接和人类做对比。

另外他们还移除了 Artificial Analysis 的 Intelligence Index，原因是对方 v4.1 改版后变成了一个智能体复合指标，里面打包的基准和 AGI Ranker 自己用的高度重合，继续留着等于重复计分。榜单本身不跑测试，只汇总别人发布的数据，并且按信源可信度分了四级，实验室自报的成绩会打折。

这件事提醒我们，看任何综合榜单都得先搞清楚它的“满分”到底代表什么。AGI Ranker 这次主动公开修正，态度是好的，但它的分数现在更像一个模型间的相对排名，离“距离 AGI 还有多远”这个口号还有不小距离。
