# 谁在改尺子：AI 榜单的两重张力

- 来源：Computing Life · Share · 鸭哥调研
- 发布时间：2026-09-14T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56659
- 原文：https://yage.ai/share/ai-benchmark-leaderboard-industry-20260913.html

## 摘要

OpenAI 发布 GPT-6 Astra 后，评测机构 Artificial Analysis 一周内两次修改评分规则，让 Astra 从落后 5 分变成与 Claude Fable 5.1 并列第一，模型本身没动过。榜单是门生意：评测方卖高价订阅需要大厂背书，厂商需要排名做营销，双方利益绑在一起。DeepSeek V4 Flash 只重训了后训练阶...

## 推荐理由

这篇评论用一件具体的事——Artificial Analysis 在 GPT-6 Astra 发布后一周内两次改评分规则，让排名从落后 5 分翻成并列第一——把 AI 榜单的商业逻辑讲透了。有版本号、有分数、有权重变化，信息扎实。对从业者来说，它不是在复述新闻，而是在提醒：你花钱订阅的排行榜，尺子可能随时跟着大厂的新模型重画。我会给高分，因为这种“拆台”视角比单纯报分数更有价值。

## 锐评

这篇文章把 AI 评测榜单的底裤扒得很干净。核心事实是：OpenAI 发布 GPT-6 Astra 后，评测机构 Artificial Analysis 一周内两次修改评分规则，让 Astra 从落后 5 分变成与 Claude Fable 5.1 并列第一，模型本身没动过。这直接点破了榜单的商业本质——评测方卖高价订阅（Pro 版每人每月 417 美元）需要大厂背书，厂商需要排名做营销，双方利益绑在一起，所谓中立性天然受限。

文章还拆解了评测体系内部的两重矛盾。一是榜单必须提供偏离日常体感的有效信息，但公信力又依赖体感来背书，一旦排名违背直觉，人们就会质疑尺子失真。知乎答主分析指出该榜单约 76% 权重存在测量缺陷，包括用大模型当裁判引入打分漂移、旧版测试集存在故障题、拒答即可刷满分等具体漏洞。二是榜单必须成为攻关目标，但又不能被刷透——同一款 Astra 在抽象推理基准上，用官方底座跑出 62.7%，换成 OpenAI 专属适配器底座直接飙到 99.9%，成本还更低。

文章没给出解决方案，但把问题拆得很清楚。缺的是对评测机构商业模式的更深层追问：当受测厂商的采纳程度直接决定评测方生存空间时，有没有可能建立真正独立于厂商利益的评测机制？这点正文没展开。
