跳到正文
Hacker News 首页

AGI Ranker 修正了评分天花板逻辑,所有模型分数掉了 6 到 15 分

Show HN: I audited my AI leaderboard scale – every score dropped 6-15 points

AGI Ranker 把 10 个公开基准测试打包成一个 0 到 100 的综合分,100 分代表摸到 AGI 门槛。最近他们做了一次审计,发现之前把几乎所有基准的满分都当成了“人类顶尖水平”,但真正有公开发表的人类对照实验的只有 GPQA Diamond 这一个(人类得分 0.81)。其余九个基准的“天花板”其实只是卷面满分,不等于人类水平。修正这个...

推荐理由:AGI Ranker 自己动手查了自己的评分逻辑,发现 10 个基准里 9 个的“人类顶尖水平”其实只是卷面满分,没有公开发表的人类对照实验支撑。修正后所有模型综合分掉了 6 到 15 分,等于之前的分都虚高了。这件事对做评估的人是个直接提醒:排行榜上的人类基线不能默认信,得看有没有实测数据。我会先打个折,因为这是方法修正而不是新发现,但透明度和具体数字让它值得上推荐。

读原文 ↗导出 Markdown