小米放出 MiMo-V2.5:3100 亿总参数,每次只激活 150 亿的稀疏 MoE 模型
XiaomiMiMo MiMo-V2.5 (not pro) - Architecture: Sparse MoE (Mixture of Experts), 310B total / 15B activated parameters
Reddit 上有人贴了小米 MiMo-V2.5 的 Hugging Face 链接,不是 Pro 版。架构是稀疏 MoE,总参数量 310B,每次推理只激活 15B 参数,相当于用 150 亿参数模型的计算量去撬动一个 3100 亿参数的知识容量。发帖人说它比更大的兄弟模型用了更“人性化”的配置,但正文没展开什么叫人性化,也没给显存需求、量化方案或跑...
推荐理由:这条消息的钩子很实在:310B 总参数但每次只激活 15B,意味着理论上比同体量稠密模型省资源,官方也说它比更大版本更适合普通配置跑。我会先打个折——正文只贴了个 Hugging Face 地址,没给显存占用、量化方式、任何基准测试,所以“普通配置”到底指什么配置完全不清楚。这点先别太激动,等实测数据出来再判断值不值得本地部署。