跳到正文
Computing Life · Share · 鸭哥调研

谁在改尺子:AI 榜单的两重张力

OpenAI 发布 GPT-6 Astra 后,评测机构 Artificial Analysis 一周内两次修改评分规则,让 Astra 从落后 5 分变成与 Claude Fable 5.1 并列第一,模型本身没动过。榜单是门生意:评测方卖高价订阅需要大厂背书,厂商需要排名做营销,双方利益绑在一起。DeepSeek V4 Flash 只重训了后训练阶...

推荐理由:这篇评论用一件具体的事——Artificial Analysis 在 GPT-6 Astra 发布后一周内两次改评分规则,让排名从落后 5 分翻成并列第一——把 AI 榜单的商业逻辑讲透了。有版本号、有分数、有权重变化,信息扎实。对从业者来说,它不是在复述新闻,而是在提醒:你花钱订阅的排行榜,尺子可能随时跟着大厂的新模型重画。我会给高分,因为这种“拆台”视角比单纯报分数更有价值。

读原文 ↗导出 Markdown