跳到正文
r/LocalLLaMA

ServiceNow 放出一个 15B 模型,一个权重包能切出 8 种速度档位,最快解码吞吐量翻 10 倍

ServiceNow-AI/SuperApriel-15B-Instruct · Hugging Face

ServiceNow 在 Hugging Face 上发了 SuperApriel-15B-Instruct,一个 15B 参数的指令模型。它最特别的地方是用了“超级网络”设计:48 层解码器里,每层都塞了 4 种不同的注意力机制(全注意力、滑动窗口、Gated DeltaNet、Kimi Delta Attention),运行时可以像换挡一样选不同组...

推荐理由:一个 15B 模型靠单一检查点覆盖 8 档推理速度,吞吐跨度超过 10 倍,对实际部署的吸引力很强,H 和 K 都站得住。R 来自它把成本-延迟-质量的权衡做成可调开关,而不是让你换模型。不过这只是推理优化方向的发布,不是前沿实验室的旗舰更新,影响范围偏窄,所以 76 分、featured 合理。

读原文 ↗导出 Markdown