# 一个把 GPT-2 拆开揉碎、让你一步步看 Transformer 内部怎么算的可交互网页

> 原标题：Transformers Explained Visually

- 来源：Hacker News 首页
- 发布时间：2026-09-21T19:43:49.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/57974
- 原文：https://poloclub.github.io/transformer-explainer/

## 摘要

Polo Club 做了一个教学用的交互页面，拿 GPT-2（小号版）当教具，把嵌入、注意力、MLP 和输出概率拆成可点击的步骤。你可以自己输入提示词，调温度和 top-k/top-p 采样，看每个 token 的 Q/K/V 矩阵和注意力权重是怎么算出来的。模型有 1.24 亿参数、12 层、词表 50257 个 token、嵌入维度 768。它跑的...

## 推荐理由

Polo Club 这个交互页面把 GPT-2 拆得很细，可调参数和采样步骤都做成了可视化，想搞懂 Transformer 内部怎么跑的人确实用得上。分数就定在这里，因为它是个教具，不是行业新闻，而且拿 GPT-2 当演示模型也不算新鲜事。

## 锐评

Polo Club 做的这个页面把 GPT-2（小号版，1.24 亿参数）当教具，把嵌入、注意力、MLP 和输出概率拆成了可点击的步骤。你可以自己输入提示词，调温度和 top-k/top-p 采样，直接看每个 token 的 Q/K/V 矩阵和注意力权重是怎么算出来的。模型有 12 层、词表 50257 个 token、嵌入维度 768，这些数字说明它是个轻量级教学模型，不是拿来干活的。

正文没提推理延迟和硬件要求，所以别把它当性能参考。它的价值在于把“自注意力到底在干嘛”这件事可视化出来，对刚接触 Transformer 的人比较友好。但要注意，它跑的是 2019 年的 GPT-2，跟现在的 GPT、Llama、Gemini 在规模和数据上差很远，架构原理相通不代表能力一样。

还缺一个关键信息：页面没说明它是在浏览器本地跑还是调后端，如果是本地跑，对机器配置有什么最低要求也没交代。这点先别太激动，打开之前最好有个心理预期。
