# SGLang 第一时间适配 Meta 的本地智能体模型 Muse Glimmer，单卡 RTX 5090 跑到每秒 1452 个 token

> 原标题：SGLang 为 Muse Glimmer 提供 Day-0 支持，针对本地智能体工作流优化推理

- 来源：AI HOT 精选
- 发布时间：2026-08-10T11:51:38.747Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/49817
- 原文：https://www.lmsys.org/blog/2026-08-10-meta-muse-glimmer

## 摘要

Meta 发布了 Muse Glimmer，一个 300 亿参数的多模态模型，专门为在本地硬件上跑智能体工作流设计。SGLang 推理框架在发布当天就提供了支持，并做了针对性优化。在单张 RTX 5090 显卡上，用 NVFP4 量化格式搭配 DFlash 投机解码技术，每个用户的解码速度能达到每秒 236 个 token，总吞吐量冲到每秒 1452 ...

## 推荐理由

Meta 发新模型本身是行业事件，但这篇文章的重点是 SGLang 的推理优化，不是模型本身。好在性能数字够硬，236 tok/s 和 1452 tok/s 这两个数让它的信息密度够上 featured。不过受众窄，只对搞本地推理的人有吸引力，所以 r 给了 false。

## 锐评

这条消息的核心是：Meta 把能跑智能体工作流的多模态模型压到了单张消费级显卡上，SGLang 推理框架第一时间做了深度适配。在 RTX 5090 上，用 NVFP4 量化加 DFlash 投机解码，单用户解码速度能到每秒 236 个 token，总吞吐冲到每秒 1452 个 token。这个数字说明在本地跑复杂智能体任务，延迟和并发都到了一个可用的水平。

模型结构上，它用滑动窗口注意力混搭全序列注意力，上下文窗口拉到 128k 以上，这是为了在长链条智能体任务里不丢上下文。不过文章没给出任何基准测试分数，只说“有竞争力的表现”，这点先别太激动。另外，Apple Silicon 那边虽然支持 MLX 后端，但投机解码还没跟上，意味着 Mac 上的速度会打折扣。

还缺什么：没有披露智能体任务的具体评测集和对比对象，也没说量化后模型能力掉多少。这些缺口让“本地跑智能体”的实际效果还悬着。
