# Artificial Analysis 发布 v4.2 智能指数，用隐藏题库防刷分，并加入模拟知识工作的新测试

> 原标题：Artificial Analysis Intelligence Index v4.2

- 来源：Hacker News 首页
- 发布时间：2026-09-05T00:04:14.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54853
- 原文：https://artificialanalysis.ai/articles/artificial-analysis-intelligence-index-v4-2

## 摘要

Artificial Analysis 更新了模型评测榜单到 v4.2 版，主要做了两件事：一是新增了 AA-Briefcase 和 GDP.pdf 两个更贴近真实场景的测试；二是把不公开的隐藏题库权重翻倍到 40%，专门防止模型厂商针对公开题刷分。AA-Briefcase 是它们自己出的隐藏题，模拟需要好几周才能完成的知识工作项目，让模型处理几千个源...

## 推荐理由

这次更新核心就一件事：防刷分。Artificial Analysis把不公开题库的权重从20%提到40%，摆明了告诉厂商别想靠背题拿高分。新增的AA-Briefcase和GDP.pdf两个测试也值得看一眼，前者让模型处理几千个源文件做长周期项目，后者直接扔一本4592页的文档考信息提取，比MMLU这类饱和基准更接地气。不过正文没披露具体模型排名变化，只说后续会陆续放出，所以现在只能当方法论预告看，别急着拿它做选型决策。

## 锐评

Artificial Analysis 把评测榜单升到 v4.2，核心就干了两件事：让考试题更贴近真实工作，以及把防作弊的力度拉满。新增的 AA-Briefcase 是个隐藏题库，模拟需要几周才能完成的知识工作项目，让模型处理几千个源文件，考察的不是单题对错，而是整个项目能不能跑通、分析质量和呈现水平怎么样。另一个 GDP.pdf 测试更极端，要求模型啃完 4592 页专业文档，对照 1275 条细粒度标准打分，只要有一条没满足，整道题就算失败。

榜单头部还是 Anthropic 和 OpenAI 在争。Claude Fable 5.1 排第一，GPT-6 Astra 比上一代 GPT-5.6 Sol 高出约 85 个 Elo 分，进步幅度不小。但更值得留意的是，隐藏题库权重从 v4.1 的 20% 直接翻倍到 40%，而且官方明说 v5 还会继续加。这说明公开题刷分已经严重到需要靠隐藏题来维持榜单可信度了。

正文没披露 AA-Briefcase 的具体题目数量和领域分布，也没说 GDP.pdf 的评分一致性校验怎么做。另外，成本效率那条曲线只给了定性描述，缺少具体每百万 token 的价格对比，想算性价比的人还得自己去翻原始数据。
