# 顶尖模型物理其实不差，是考题和评分标准本身出了大问题

> 原标题：How good are frontier models at physics?

- 来源：Hacker News 首页
- 发布时间：2026-09-16T19:19:08.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/56934
- 原文：https://arxiv.org/abs/2609.13009

## 摘要

耶鲁等机构的研究人员找来物理系教授和博士生，把六个常用物理基准测试的评分重新审了一遍。结果发现，之前被判错的答案，大部分是评分程序出错、参考答案本身是错的，或者题目问得不清不楚。以 GPT-5.6-Sol 为例，在 HLE-Physics 上，修正后的 mean@4 从 47.3% 跳到了 78.7%；在 CMT-Benchmark 上，从 61.0%...

## 推荐理由

耶鲁等机构的研究人员拉来物理系教授和博士生，把六个常用物理基准测试的评分重新审了一遍。结果发现，之前被判错的答案，大部分是评分程序出错、参考答案本身是错的，或者题目问得不清不楚。以 GPT-5.6-Sol 为例，在 HLE-Physics 上，修正后的 mean@4 从 47.3% 跳到了 78.7%；在 CMT-Benchmark 上，从 61.0% 跳到 89.1%，接近满分。这个涨幅说明，很多“模型物理不行”的判断，其实是基准本身质量不行。我会先打个折：正文没披露重新评分时有没有统一标准、不同评审之间一致性如何，这点先别太激动。但至少提醒我们...

## 锐评

这条研究戳破了一个我们早就该怀疑的事：很多物理基准测试的分数低，不是模型不行，是考试本身有问题。耶鲁等机构的研究人员拉来物理系教授和博士生，把六个常用物理基准测试的评分重新审了一遍。结果发现，之前被判错的答案，大部分是评分程序出错、参考答案本身是错的，或者题目问得不清不楚。以 GPT-5.6-Sol 为例，在 HLE-Physics 上，修正后的 mean@4 从 47.3% 跳到了 78.7%；在 CMT-Benchmark 上，从 61.0% 涨到 87.2%。这个涨幅说明，这些封闭式题目对顶尖模型来说已经快被做穿了，继续拿它们当标尺意义不大。

不过，先别急着欢呼模型已经搞定物理。这项研究只看了有明确最终答案的纯文本题，没碰需要看图、做实验或者开放式推理的题目。而且，正文没披露专家重新判卷时是否知道这是模型生成的答案，如果知道，可能会有意无意地给模型放水。另外，修正后的分数接近饱和，恰恰暴露了现有基准的瓶颈——我们需要更难、经过专家验证的新考题，而不是继续在漏水的桶里量水位。
