# WebLLM：浏览器里直接跑大模型，不用装显卡驱动

> 原标题：WebLLM: high-performance in-browser LLM inference engine

- 来源：Hacker News 首页
- 发布时间：2026-09-02T14:02:35.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/54320
- 原文：https://github.com/mlc-ai/web-llm

## 摘要

MLC-AI 开源的 WebLLM 让你在浏览器里直接跑 Llama、Gemma 等大模型，靠 WebGPU 加速，在普通消费级显卡上能达到接近原生的速度。好处是隐私数据不出本地，离线也能用，适合做个人助手或敏感场景。代价是首次加载要下载几个 GB 的模型权重，内存占用也高，别指望它能替代云端推理。
