# 小米声称在标准8卡服务器上把1万亿参数模型跑到了每秒1000多个token

> 原标题：Xiaomi just claimed 1,000+ tps on a 1T model using a standard 8-GPU server

- 来源：r/LocalLLaMA
- 发布时间：2026-06-08T15:51:46.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35622
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1u0buhm/xiaomi_just_claimed_1000_tps_on_a_1t_model_using/

## 摘要

小米的MiMo团队发布了MiMo-V2.5-Pro UltraSpeed，说他们在单台8卡的标准服务器上，把一个1万亿参数的混合专家模型（MoE）跑出了每秒超过1000个token的输出速度。这个速度如果属实，确实挺夸张，因为它没用Cerebras那种整块晶圆做的定制芯片，也没用Groq那种靠大量片上内存堆出来的硬件，就是普通GPU服务器。不过帖子正文...

## 推荐理由

小米说他们在标准8卡服务器上把一个1万亿参数的MoE模型跑出了每秒1000+ token的输出速度，没用Cerebras那种整晶圆芯片，也没用Groq那种靠大量片上内存堆硬件的方案。这个速度如果是真的，确实挺省钱，但正文没披露GPU型号、批次大小、量化精度这些决定性能的关键参数，也没给可复现的测试环境，所以我会先打个折，等更多细节出来再判断。

## 锐评

小米MiMo团队放出的这个速度数字确实抓眼球：一个1万亿参数的混合专家模型，在单台8卡服务器上跑到每秒超1000个token的输出。对比一下，Cerebras靠整块晶圆做的芯片、Groq靠大量片上内存才敢说自己快，小米说用普通GPU就做到了，如果属实，意味着大模型本地部署的成本门槛可能被拉低一大截。

但帖子正文和链接里都没披露关键信息：用的到底是H100还是B200？是单用户请求还是攒了大批次？测的是首token延迟还是稳态吞吐？这些不交代，1000这个数字就没法复现，也没法跟其他方案公平比较。Reddit原帖也只是转述官方说法，没有独立验证。

我会先打个折看这个数字。真正值得关注的是小米有没有公开技术报告或推理框架的配置细节，以及第三方什么时候能跑一次同样的测试。在那之前，这更像一个营销信号，而不是一个可参考的工程基准。
