# 你的模型早就知道答案了：基准测试的答案是怎么溜进大模型的

> 原标题：Your model already knows the answer: how benchmark answers leak into LLMs

- 来源：Hacker News 首页
- 发布时间：2026-08-05T16:56:56.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48951
- 原文：https://elman.ai/news/your-model-already-knows-the-answer/

## 摘要

用真实世界的结果考 AI 最硬核，但也最容易作弊。文章把答案泄露分成三条路：输入泄露（测试时喂了带答案的文件）、基准泄露（考题直接进了训练数据）和结果泄露（模型在预训练时从论文、新闻、专利里学到了公开事实）。结果泄露最头疼，就算你出一套全新的、屏蔽了日期的考题，模型照样能认出某款知名药成功了，因为这是它早就学到的常识。等事件出结果再测当然干净，但药物研...

## 推荐理由

三条泄露路径的拆解很清晰，临床试验的例子也够具体。但文章本质是 Elman 的公司博客，背后有产品推销的影子，只把问题摊开没给解法，所以分数停在 78。

## 锐评

这篇文章把基准测试的污染问题讲得很透，尤其是他们自己定义的“结果泄露”这条路。简单说，你想考模型预测某款知名药能不能成，但模型在预训练时早就从铺天盖地的论文、新闻和专利里知道了结果。这时候它答对，你根本分不清它是真会推理，还是单纯记性好。文章点出了一个很棘手的死结：用已发生的事件做考题，结果才真实、才有含金量，但结果一旦公开，就必然会被模型学到，考题就“脏”了。

作者来自做临床试验AI的公司Elman，所以他们举的药物研发例子很扎实。文章梳理了八种缓解方法，但大部分只针对“考题直接进了训练数据”这种泄露，能应对“结果泄露”的只有三种，而且代价都不小。比如等事件出结果再测最干净，但一个药从二期临床到获批可能要十年，根本等不起。

文章没给出万能解法，更像是在提醒所有做评测的人：别光盯着分数看，先想想模型是不是早就背过答案了。这点对于依赖公开历史数据做测试的金融、法律等领域同样适用。不过，正文没披露他们自己的产品具体用了哪种防泄露方案，这点信息是缺的。
