# TokenTown：把 Transformer 推理过程变成一座立体城市，在浏览器里一步步跑给你看

> 原标题：TokenTown: A visual way to understand how LLMs work

- 来源：Hacker News 首页
- 发布时间：2026-07-29T13:05:17.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47409
- 原文：https://laurentiugabriel.github.io/token-town/

## 摘要

这是一个在浏览器里实时运行的交互式演示，把语言模型的推理过程画成了一座等距城市。每个 token 会先在码头被切分，在铸造厂转成向量，打上位置标记，然后沿着注意力广场、残差桥、前馈工厂等区域跑完每一层，最后在词汇体育场算出概率并采样出下一个词。界面里的向量条和 softmax 光束都是真实计算的，只是维度缩到了 12 维、词汇量也只有几百个。模型权重是...

## 推荐理由

一个把 transformer 推理映射成城市漫游的交互演示，浏览器里跑真实向量和 softmax，教学和沟通价值很高，但本质是教育项目，不是产品更新或研究突破，所以重要性给 78、放 featured 合理。

## 锐评

TokenTown 把语言模型的一次推理跑成一座城市里的物流路线：分词码头、向量铸造厂、注意力广场、残差桥、前馈工厂，最后在词汇体育场算概率、抽下一个词。界面里那些向量条和 softmax 光束不是动画贴图，是浏览器里真实计算的，只是维度缩到了 12 维、词汇量只有几百个，权重也是随机的。为了让输出能读，作者把随机模型的 logits 和一个基于小语料库的二元词频先验做了混合，注意力分数也加了 sink token 和近因偏差，所以看起来像训练过的模型。

这个项目最大的价值是教学：第一圈每个区域会暂停 9 到 26 秒弹出解释，之后可以加速、单步或自由漫游。它把“残差流”“KV 缓存”“因果掩码”这些概念变成了能追着看的空间关系。但要注意，正文明确说了权重没训练过，所以别拿它产出的文本当真——那是布景，机制才是正课。另外，12 维的向量和真实模型上千维的隐藏状态差距很大，softmax 的稀疏模式在低维下也会失真，这点作者没展开讨论。如果你用它来理解 Transformer 的数据流，它很直观；如果你想用它来理解为什么某个注意力头会关注某个位置，它帮不上忙。
