# Allen AI 用心理测量学给大模型基准做“体检”，发现很多题目测的根本不是你以为的能力

> 原标题：BenchMIRT: What are LLM benchmarks actually measuring?

- 来源：Hugging Face 博客
- 发布时间：2026-09-01T21:39:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/55239
- 原文：https://huggingface.co/blog/allenai/benchmirt

## 摘要

Allen AI 开源了一套叫 BenchMIRT 的方法，用多维项目反应理论（MIRT）来审查大模型评测基准到底在考什么。他们分析了 100 个模型在 16 个基准、超过 3.4 万道题上的表现，没给任何预设，系统自动分离出两个核心能力维度：安全性和通用推理能力。比如 BBQ 基准里一道关于祖孙俩叫 Uber 的题，表面测年龄偏见，实际上还要求模型理...

## 推荐理由

Allen AI 开源了一套方法，拿项目反应理论来审计评测基准，背后有 100 个模型和 3.4 万道题撑腰。分数没上 80 是因为它是个方法论工具，不是能直接上线的产品更新，但 H、K、R 三个点都踩实了，信息也够硬。

## 锐评

这条新闻值得点开看，因为它直接戳破了当前大模型评测的一个常见问题：我们以为在测 A，其实题目里混着 B 和 C。Allen AI 开源了 BenchMIRT，用多维项目反应理论分析了 100 个模型在 16 个基准、超过 3.4 万道题上的表现。系统没靠人工预设，自动分离出两个核心能力维度：安全性和通用推理。

举个例子，BBQ 基准里那道“祖孙俩叫 Uber”的题，表面考年龄偏见，实际上还要求模型理清人物关系并基于证据推理。WildJailbreak 基准更明显，有害的越狱提示和良性提示分别对应安全与推理两个维度，粗暴地算平均分就把这个分裂给藏起来了。这套方法还能找出哪些题最能区分强模型和弱模型，意味着以后可以用更少的题做更干净的评测。

不过，正文没披露这 100 个模型的具体构成和规模分布，也没说明分离出的两个维度是否足以覆盖所有基准的考察点。如果模型池里缺少某些类型，结论的普适性就得打个折。代码、数据和技术报告都公开了，建议直接去看原始数据里自己关心的基准被拆成了什么样。
