# 小米 MiMo 在单台 8 卡服务器上把万亿参数模型跑到每秒 1000+ token

> 原标题：小米 MiMo-V2.5-Pro-UltraSpeed 突破 1，000 tokens/s，单台 8-GPGPU 节点运行 1T MoE 模型

- 来源：AI HOT 精选
- 发布时间：2026-06-08T14:37:21.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35613
- 原文：https://x.com/XiaomiMiMo/status/2063993790587904362

## 摘要

小米和 TileRT_AI 放出了一个叫 MiMo-V2.5-Pro-UltraSpeed 的版本，用一台普通的 8 卡 GPU 节点就跑起了 1 万亿参数的 MoE 模型，输出速度超过每秒 1000 个 token。这个速度不是靠 Cerebras 或 Groq 那种专用硬件堆出来的，对常规部署来说挺省钱。他们开了限时免费聊天可以上手试，API 价格...

## 推荐理由

小米这个版本最吸引人的点是用普通 8 卡 GPU 节点把 1T MoE 模型跑到每秒上千 token，没靠 Cerebras 那种专用硬件，部署成本听起来低了不少。我会先打个折：正文没披露具体任务类型、精度损失、首 token 延迟和实际 API 定价，所以这个速度是在什么条件下测的还不清楚。限时免费聊天可以上手试，但长期性价比得等更多数据。这点先别太激动，不过如果属实，对常规推理部署确实挺省钱。

## 锐评

小米和TileRT_AI放出的这个版本，核心卖点是用一台标准8卡GPU节点就跑起了1万亿参数的MoE模型，输出速度超过1000 token/秒。这个速度以前通常得靠Cerebras或Groq那种专用硬件才能达到，现在用普通GPU就能做到，对想省硬件成本的团队是个好消息。

不过要注意几点：正文只说了输出速度，没提输入处理延迟和首token响应时间，这两个指标在实际聊天体验里同样关键。API价格是标准版的3倍，但声称输出体验提升约10倍，这个性价比账得自己算。限时免费聊天体验和API申请窗口只到6月23日，想上手试的得抓紧。

还缺什么：没看到具体用了什么推理优化技术，是量化、投机解码还是别的方案；也没披露模型在长文本、多轮对话下的速度稳定性，以及并发请求时的性能表现。这些都会影响实际部署效果。
