# 一块 8 美元的 ESP32-S3 单片机，自己跑完了一个字符级 Transformer 的完整训练

> 原标题：An SLM trained on $8 ESP32-S3

- 来源：Hacker News 首页
- 发布时间：2026-08-05T04:07:27.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48854
- 原文：https://github.com/Carloscodix/qapla

## 摘要

这个项目把训练循环整个塞进了一颗 8 美元的 ESP32-S3 芯片里，不是只做推理，连反向传播都是用 C 语言手写的。代码库只提交了 6 次，没公布参数量、数据集大小和训练时长，所以别把它当实用工具看。它更像一个极限工程演示——在单片机上把模型训练跑通，这件事本身就够疯。

## 推荐理由

在 8 美元的 ESP32-S3 上跑完整训练循环，连反向传播都用 C 手写，这是个极限工程演示，H 和 K 都拉满。但仓库只有 6 次提交，参数量、数据集大小、训练时长一概没提，实用价值几乎为零，R 不成立。给 72 分放在 featured 档，是因为这件事够疯，但信息缺口太大，我会先打个折。

## 锐评

这个项目把训练循环整个塞进了一颗 8 美元的 ESP32-S3 芯片里，不是只做推理，连反向传播都是用 C 语言手写的。代码库只提交了 6 次，没公布参数量、数据集大小和训练时长，所以别把它当实用工具看。它更像一个极限工程演示——在单片机上把模型训练跑通，这件事本身就够疯。

正文没披露模型到底多大、用了什么数据、训练了多久。这些信息缺了，就没法判断它到底省了多少资源，或者有没有实际用途。代码是公开的，但只有 6 次提交，说明项目还非常早期。

如果数据属实，这意味着训练门槛被拉到了一个夸张的低点。但先别太激动——字符级 transformer 本身能力有限，加上硬件限制，能做的事大概率就是玩具级别的文本生成。想知道它到底能不能用，还得看作者后续会不会补上基准测试和具体参数。
