WebLLM:浏览器里直接跑大模型,不用装显卡驱动
WebLLM: high-performance in-browser LLM inference engine
MLC-AI 开源的 WebLLM 让你在浏览器里直接跑 Llama、Gemma 等大模型,靠 WebGPU 加速,在普通消费级显卡上能达到接近原生的速度。好处是隐私数据不出本地,离线也能用,适合做个人助手或敏感场景。代价是首次加载要下载几个 GB 的模型权重,内存占用也高,别指望它能替代云端推理。
WebLLM: high-performance in-browser LLM inference engine
MLC-AI 开源的 WebLLM 让你在浏览器里直接跑 Llama、Gemma 等大模型,靠 WebGPU 加速,在普通消费级显卡上能达到接近原生的速度。好处是隐私数据不出本地,离线也能用,适合做个人助手或敏感场景。代价是首次加载要下载几个 GB 的模型权重,内存占用也高,别指望它能替代云端推理。