# 在 Chrome 插件里跑本地 AI：一份给开发者的架构避坑指南

> 原标题：How to Use Transformers.js in a Chrome Extension

- 来源：Hugging Face 博客
- 发布时间：2026-04-23T00:00:00.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/10428
- 原文：https://huggingface.co/blog/transformersjs-chrome-extension

## 摘要

Hugging Face 发了一篇技术指南，拆解了他们刚做的 Chrome 插件“Transformers.js Gemma 4 浏览器助手”。核心是把 Gemma 4 E2B 模型塞进浏览器的后台 Service Worker 里本地运行，不靠云端。文章重点讲了 Manifest V3 下三个运行环境的职责划分：后台负责跑模型推理，侧边栏做聊天界面，...

## 推荐理由

这是一篇 Hugging Face 的实操教程，不是模型或平台发布，但把 MV3 架构拆解得挺具体。我会先打个折，因为正文没给出实际延迟或内存占用的测试数据，效果验证还缺一块。不过对想在前端跑本地模型的开发者来说，这篇的工程参考价值够得上 featured 门槛。

## 锐评

这篇指南把 Chrome 插件跑本地模型的坑讲得很实在。核心思路是把 Gemma 4 E2B 模型放在后台 Service Worker 里做推理，侧边栏只负责聊天界面，内容脚本处理页面操作，三个环境各干各的，靠消息通信串起来。这样设计的好处是模型常驻后台，不会因为切换页面就重新加载，但代价是 Service Worker 本身有内存和存活时间限制，模型一大就容易崩。

文章没给出具体的推理延迟和内存占用数据，只说“跑通了”。如果你真打算在生产环境用，我会先打个折——Gemma 4 E2B 是个 20 亿参数的模型，在浏览器里跑推理，首字延迟大概率在秒级，而且模型下载一次就要几个 G，用户第一次打开插件得等半天。另外，工具调用循环的设计细节也写得比较简略，只提了 Agent.runAgent 这个方法，没展开讲怎么处理工具调用失败或超时。

还缺两块关键信息：一是模型量化到什么程度，这直接决定能不能在 8G 内存的机器上跑；二是 Service Worker 被系统休眠后怎么恢复推理状态，正文没提。
