# AirLLM 让一张 4GB 显卡就能跑 70B 大模型

> 原标题：AirLLM 70B inference with single 4GB GPU

- 来源：Hacker News 首页
- 发布时间：2026-08-03T11:15:48.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48443
- 原文：https://github.com/lyogavin/airllm

## 摘要

这个开源库把 Llama 3 70B 这样的大模型按层拆开，每次只加载一层到显存里算，算完再换下一层，所以一张只有 4GB 显存的普通显卡也能跑推理，不用多卡并联。它支持 Llama、Mistral、ChatGLM 等主流架构，直接兼容 HuggingFace 上的模型。代价是速度会慢不少，但把本地跑大模型的硬件门槛压到了笔记本级别。

## 推荐理由

把 70B 模型拆成一层一层轮流塞进显存，不是新思路，但做成开箱即用的库确实省事。正文没给具体延迟数据，速度会打折这点得心里有数，所以分数没往上拉。
