Muse Glimmer:把智能体塞进你设备的,其实是一套伪装成 30B 模型的内存层级
Muse Glimmer is a memory hierarchy disguised as a 30B Transformer
Meta 的 Muse Glimmer 是个约 300 亿参数的多模态模型,专门为在手机或电脑上离线跑智能体任务设计。它的原始 BF16 模型有 55 GiB,根本塞不进消费级显卡,所以 Meta 直接给了 4-bit 量化版,把语言模型压到了 20 GB 以下。架构上最特别的是它的注意力机制:总共 52 层里,只有每第四层会看全部上下文,其余 39 ...
推荐理由:一篇扎实的架构拆解,把量化代价、注意力分层、QK 归一化这些关键点都讲清楚了。但它是第三方分析而非官方发布,纯技术视角对非端侧方向的从业者不太友好,所以放在 featured 刚好。