小米声称在标准8卡服务器上把1万亿参数模型跑到了每秒1000多个token
Xiaomi just claimed 1,000+ tps on a 1T model using a standard 8-GPU server
小米的MiMo团队发布了MiMo-V2.5-Pro UltraSpeed,说他们在单台8卡的标准服务器上,把一个1万亿参数的混合专家模型(MoE)跑出了每秒超过1000个token的输出速度。这个速度如果属实,确实挺夸张,因为它没用Cerebras那种整块晶圆做的定制芯片,也没用Groq那种靠大量片上内存堆出来的硬件,就是普通GPU服务器。不过帖子正文...
推荐理由:小米说他们在标准8卡服务器上把一个1万亿参数的MoE模型跑出了每秒1000+ token的输出速度,没用Cerebras那种整晶圆芯片,也没用Groq那种靠大量片上内存堆硬件的方案。这个速度如果是真的,确实挺省钱,但正文没披露GPU型号、批次大小、量化精度这些决定性能的关键参数,也没给可复现的测试环境,所以我会先打个折,等更多细节出来再判断。