跳到正文
AI HOT 精选

JetBrains 发布 Mellum2:一个 12B 参数的混合专家模型,每次推理只激活 2.5B 参数

介绍 Mellum2:JetBrains 推出的 12B 混合专家模型

JetBrains 在 Hugging Face 上开源了 Mellum2,一个从零开始训练的混合专家模型。它总共有 120 亿参数,但每次计算只激活其中的 25 亿,这让它跑起来比同尺寸模型快了一倍多,适合对延迟和吞吐量要求高的场景。模型专门处理文本和代码,不做多模态,主要用在路由分发、外挂资料库检索、摘要和子智能体这些需要频繁调用模型但不必上大模型...

推荐理由:HKR 三项都过,但正文只给了 12B 和 MoE 这两个信息,没放跑分、没提许可证、没写上下文窗口,也没说怎么跟自家 IDE 集成。先按中等量级的模型发布处理,放在 featured 里偏低的档位。

读原文 ↗导出 Markdown