跳到正文
r/LocalLLaMA

小米上线 MiMo V2.5,用 DFlash 和 Persistent Kernel 把推理速度拉到每秒 1000–3000 token

Xiaomi is now serving MiMo V2.5 at 1000-3000tps using DFlash & Persistent kernel. DFLash model is out, open-source release promised coming soon

小米的 MiMo V2.5 模型已经对外服务,官方宣称推理速度达到每秒 1000 到 3000 个 token,靠的是 DFlash(一种加速注意力计算的机制)和 Persistent Kernel(让 GPU 核心持续干活不空转)。DFlash 的模型权重已经放出来了,开源代码也说很快会发。不过 Reddit 原帖正文被安全策略拦了,只剩标题,所以实...

推荐理由:MiMo V2.5 宣称的 1000-3000 tps 和两个具名加速机制(DFlash、Persistent Kernel)信息量够硬,权重已出、代码承诺开源,对本地部署的人直接有用。分数没给更高是因为 Reddit 正文被拦了,只剩标题,很多细节没法核实,这点先别太激动。

读原文 ↗导出 Markdown