# Prime Intellect 让 18 个前沿模型比赛自动优化 NanoGPT，Fable 5 把验证损失压到 2,726，追平了人类最优记录 81.7...

> 原标题：NanoGPT Speedrun Frontier

- 来源：Hacker News 首页
- 发布时间：2026-08-22T22:14:27.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/52292
- 原文：https://www.primeintellect.ai/research/nanogpt-speedrun

## 摘要

Prime Intellect 搞了一场“极速挑战”，把 18 个前沿模型分别配上编程助手，让它们自己动手改 NanoGPT 的训练脚本，目标是尽可能降低验证损失。Fable 5 搭配 Claude Code 跑出了 2,726 的最好成绩，把人类基线到最优记录之间的差距补上了 81.7%。第二名 Opus 5 和第三名 Kimi K3 分别补上了 5...

## 推荐理由

Prime Intellect 搞的这场极速挑战，让模型自己动手改 NanoGPT 训练脚本，比的是谁能把验证损失压到最低。Fable 5 加 Claude Code 跑出 2,726，把人类基线和最优记录之间的差距补上了 81.7%，第二名和第三名只补了 5% 左右，领先优势非常明显。排行榜、方法和具体数字都公开，对做 agent 和看 benchmark 的人有直接用处。

## 锐评

Prime Intellect 让 18 个模型自己动手改 NanoGPT 训练脚本，比谁把验证损失压得最低。Fable 5 搭配 Claude Code 跑出 2,726，把人类基线和最优记录之间的差距补上了 81.7%，第二名 Opus 5 只补了 53.6%，差距拉得挺开。DeepSeek V4 Pro 排第 13，只补了 12.3%，表现意外地弱。

数字看着热闹，但得打个折。这测试只考一件事：模型能不能在已知代码上做长时间自主优化。Fable 5 跑了 8.7 天，烧了 8 亿 token，成本不低。正文没披露各模型具体用了什么优化策略，也不知道跑挂的那些是卡在哪一步。所以这个排名只能说明谁更稳、更敢试，不能直接等于谁的编程能力更强。

还缺一个关键信息：这些优化出来的脚本，换到别的任务上还能不能打？如果只是针对这一个脚本调参，那实际价值就有限了。
