# 一个交互式网页，用可视化的方式拆解大语言模型是怎么造出来的

> 原标题：Show HN: How LLMs Work – Interactive visual guide based on Karpathy's lecture

- 来源：Hacker News 首页
- 发布时间：2026-04-24T06:48:53.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/9565
- 原文：https://ynarwal.github.io/how-llms-work/

## 摘要

作者把 Andrej Karpathy 的技术讲座做成了一个可以点着看的网页教程，从爬互联网数据开始，一路讲到模型怎么生成文字。里面给了几个具体数字：训练用了 15 万亿个 token，模型参数 4050 亿，原始文本数据 44TB，词表大小 10 万个。网页把流程拆成了数据收集、分词、训练、推理和基础模型行为这几步，每一步都有动画或可交互的演示，比如...

## 推荐理由

我会先打个折：这不是新研究，是把 Karpathy 的公开课做成交互教材。但做得扎实——从 Common Crawl 抓数据、BPE 分词、Transformer 训练到温度采样，全流程可视化，还给了 15T tokens、405B 参数这些量级数字，让人对 LLM 的规模有体感。对想补基础的人很友好，正文没披露什么新 benchmark 或成本数据，所以别当行业信号看，就当一份高质量的学习材料。

## 锐评

这不是新研究，而是一个教学工具，把 Andrej Karpathy 的技术讲座变成了能点、能看动画的网页。它用一套具体数字串起整个流程：从 Common Crawl 抓取 27 亿网页，经过滤、去重、脱敏后得到 44TB 文本，也就是约 15 万亿个 token，最终训练出一个 4050 亿参数的模型。

这个教程的价值在于把抽象概念具象化了。比如分词环节，它直接演示 BPE 算法怎么把文本切成 10 万个词表里的子词单元，并解释为什么不用整词——因为“run”、“running”共享词根能省词表空间，还能处理拼写错误。训练部分则展示了损失值从 11.2 降到 2.4 的过程中，模型输出如何从乱码变成通顺英语。

不过要留个心：正文没披露这个 4050 亿参数模型具体是哪个，也没给出训练用了多少 GPU、花了多少钱。这些数字更像是为了教学选的代表性数值，别直接当成某个特定模型的真实配置。另外，网页本身是静态教程，不涉及实时训练或推理，所以别指望能跑模型。整体来看，这是个质量不错的入门材料，适合想搞懂 LLM 内部流水线但不想啃论文的人。
