跳到正文
Hacker News 首页

AI 评测基准饱和了怎么办?这篇 ICML 论文系统研究了 60 个基准的失效规律

When AI Benchmarks Plateau: A Systematic Study of Benchmark Saturation

这篇被 ICML 2026 接收的论文给“基准饱和”下了个明确定义,然后拿 60 个语言模型评测基准开刀。结论挺直接:将近一半的基准已经饱和了,也就是模型分数快刷到顶,拉不开差距了。越老的基准饱和得越快。有个反直觉的发现——把测试数据藏起来并不能延缓饱和,真正管用的是找专家来精心出题。论文没点名具体是哪些基准,但梳理出了 14 种容易导致饱和的特征,相...

推荐理由:ICML 2026 的论文,对 60 个基准做了系统性审计,发现近一半已经饱和,而且藏测试集这招不管用。研究扎实,结论反直觉,对做评测和看榜单的人都有直接参考价值。没点名具体基准,限制了即时冲击力,所以分数定在 78。

读原文 ↗导出 Markdown