# Alec Radford 用只学到 1930 年的模型，接下了哈萨比斯的 AGI 考题

> 原标题：哈萨比斯出的难题，GPT之父接上了：用一个知识停在1930年的模型

- 来源：机器之心 · 公众号
- 发布时间：2026-04-30T04:50:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/12612
- 原文：https://mp.weixin.qq.com/s?__biz=MzA3MzI4MjgzMw==&mid=2651031116&idx=2&sn=fb6006ee2ab440c5bd27906b24641b4c

## 摘要

Alec Radford 团队训了一个 13B 的模型，训练数据全是 1931 年之前的英文文本，总共 2600 亿 token。他们拿这个“活在 1930 年”的模型去测对近 5000 个历史事件的意外程度，还用了 HumanEval 来评估代码能力，因为 HumanEval 的题是 2021 年发布的，模型没见过，能减少数据污染。核心发现是时间泄漏...

## 推荐理由

我会先打个折：正文没披露模型架构细节和训练成本，这点先别太激动。但选题本身很聪明——用1930年知识截止做对照实验，比单纯刷榜有意思。13B模型对战后事件有模糊感知，说明数据清洗再严格也挡不住泄漏，这对做安全对齐和评测的人是个实在提醒。2600亿token、近5000条事件测试这些数字让结论有分量，不是空对空。整体是扎实的研究发布，不是模型或平台上线，82分合理。

## 锐评

这个实验挺有意思：团队把训练数据严格卡在 1931 年之前，总共 2600 亿 token，训出一个 13B 的模型，然后拿近 5000 个历史事件去测它的“意外程度”。结果模型对二战后的事件还是有点模糊感知，说明即便切断了直接的时间线，模型仍可能从旧文本的推理模式或隐含规律里学到些东西。这给“用截止日期防数据污染”的思路泼了盆冷水。

他们还用 HumanEval 测代码能力，理由是这套题 2021 年才发布，模型没见过，能减少污染。这个设计挺聪明，但正文没披露具体得分，只说验证了时间泄漏问题。我会先打个折：13B 的规模不算大，2600 亿 token 在旧文本里也算不上特别充裕，结论能不能推到更大的模型上还不清楚。另外，模型对历史事件的“意外程度”怎么量化、阈值怎么定，正文也没细说，这点先别太激动。
