跳到正文
机器之心 · 公众号

Alec Radford 用只学到 1930 年的模型,接下了哈萨比斯的 AGI 考题

哈萨比斯出的难题,GPT之父接上了:用一个知识停在1930年的模型

Alec Radford 团队训了一个 13B 的模型,训练数据全是 1931 年之前的英文文本,总共 2600 亿 token。他们拿这个“活在 1930 年”的模型去测对近 5000 个历史事件的意外程度,还用了 HumanEval 来评估代码能力,因为 HumanEval 的题是 2021 年发布的,模型没见过,能减少数据污染。核心发现是时间泄漏...

推荐理由:我会先打个折:正文没披露模型架构细节和训练成本,这点先别太激动。但选题本身很聪明——用1930年知识截止做对照实验,比单纯刷榜有意思。13B模型对战后事件有模糊感知,说明数据清洗再严格也挡不住泄漏,这对做安全对齐和评测的人是个实在提醒。2600亿token、近5000条事件测试这些数字让结论有分量,不是空对空。整体是扎实的研究发布,不是模型或平台上线,82分合理。

读原文 ↗导出 Markdown