小米 MiMo 在单台 8 卡服务器上把万亿参数模型跑到每秒 1000+ token
小米和 TileRT_AI 放出了一个叫 MiMo-V2.5-Pro-UltraSpeed 的版本,用一台普通的 8 卡 GPU 节点就跑起了 1 万亿参数的 MoE 模型,输出速度超过每秒 1000 个 token。这个速度不是靠 Cerebras 或 Groq 那种专用硬件堆出来的,对常规部署来说挺省钱。他们开了限时免费聊天可以上手试,API 价格...
推荐理由:小米这个版本最吸引人的点是用普通 8 卡 GPU 节点把 1T MoE 模型跑到每秒上千 token,没靠 Cerebras 那种专用硬件,部署成本听起来低了不少。我会先打个折:正文没披露具体任务类型、精度损失、首 token 延迟和实际 API 定价,所以这个速度是在什么条件下测的还不清楚。限时免费聊天可以上手试,但长期性价比得等更多数据。这点先别太激动,不过如果属实,对常规推理部署确实挺省钱。