跳到正文
Hacker News 首页

你的模型早就知道答案了:基准测试的答案是怎么溜进大模型的

Your model already knows the answer: how benchmark answers leak into LLMs

用真实世界的结果考 AI 最硬核,但也最容易作弊。文章把答案泄露分成三条路:输入泄露(测试时喂了带答案的文件)、基准泄露(考题直接进了训练数据)和结果泄露(模型在预训练时从论文、新闻、专利里学到了公开事实)。结果泄露最头疼,就算你出一套全新的、屏蔽了日期的考题,模型照样能认出某款知名药成功了,因为这是它早就学到的常识。等事件出结果再测当然干净,但药物研...

推荐理由:三条泄露路径的拆解很清晰,临床试验的例子也够具体。但文章本质是 Elman 的公司博客,背后有产品推销的影子,只把问题摊开没给解法,所以分数停在 78。

读原文 ↗导出 Markdown