# ServiceNow 放出一个 15B 模型，一个权重包能切出 8 种速度档位，最快解码吞吐量翻 10 倍

> 原标题：ServiceNow-AI/SuperApriel-15B-Instruct · Hugging Face

- 来源：r/LocalLLaMA
- 发布时间：2026-04-22T14:10:38.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/8451
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1ssmo1c/servicenowaisuperapriel15binstruct_hugging_face/

## 摘要

ServiceNow 在 Hugging Face 上发了 SuperApriel-15B-Instruct，一个 15B 参数的指令模型。它最特别的地方是用了“超级网络”设计：48 层解码器里，每层都塞了 4 种不同的注意力机制（全注意力、滑动窗口、Gated DeltaNet、Kimi Delta Attention），运行时可以像换挡一样选不同组...

## 推荐理由

一个 15B 模型靠单一检查点覆盖 8 档推理速度，吞吐跨度超过 10 倍，对实际部署的吸引力很强，H 和 K 都站得住。R 来自它把成本-延迟-质量的权衡做成可调开关，而不是让你换模型。不过这只是推理优化方向的发布，不是前沿实验室的旗舰更新，影响范围偏窄，所以 76 分、featured 合理。

## 锐评

这个模型把“一个模型适配多种硬件”做得比较实在。它在一个 48 层的网络里，每层都塞了 4 种不同的注意力机制，运行时可以像换挡一样选不同组合，从全注意力一路切到更省资源的滑动窗口或 Delta 注意力。官方给了 8 个预设档位，在 32K 序列长度下，最快档的解码吞吐量是最慢档的 10.7 倍。这对本地部署的人来说很友好，不用为了速度和质量来回换模型，一个权重文件就能搞定。

不过要注意，信息来自 Reddit 帖子和 Hugging Face 页面，没有独立的第三方评测。10.7 倍这个数字是在特定长度和硬件下测的，换到你的场景里得自己跑一遍。另外，正文没披露不同档位下的具体质量损失有多大，比如在 HumanEval 或 MMLU 上掉多少分，这点先别太激动。模型是从 Apriel-1.6 用随机蒸馏和针对性微调得来的，基础能力有保障，但上限还得看实测。
