一个交互式网页,用可视化的方式拆解大语言模型是怎么造出来的
Show HN: How LLMs Work – Interactive visual guide based on Karpathy's lecture
作者把 Andrej Karpathy 的技术讲座做成了一个可以点着看的网页教程,从爬互联网数据开始,一路讲到模型怎么生成文字。里面给了几个具体数字:训练用了 15 万亿个 token,模型参数 4050 亿,原始文本数据 44TB,词表大小 10 万个。网页把流程拆成了数据收集、分词、训练、推理和基础模型行为这几步,每一步都有动画或可交互的演示,比如...
推荐理由:我会先打个折:这不是新研究,是把 Karpathy 的公开课做成交互教材。但做得扎实——从 Common Crawl 抓数据、BPE 分词、Transformer 训练到温度采样,全流程可视化,还给了 15T tokens、405B 参数这些量级数字,让人对 LLM 的规模有体感。对想补基础的人很友好,正文没披露什么新 benchmark 或成本数据,所以别当行业信号看,就当一份高质量的学习材料。