# 小米发布 MiMo-V2.5-Pro-UltraSpeed，万亿参数模型跑到每秒 1000 个 token

> 原标题：MiMo-v2.5-Pro-UltraSpeed: 1T model with 1000 tokens per second

- 来源：Hacker News 首页
- 发布时间：2026-06-08T15:27:33.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35618
- 原文：https://mimo.xiaomi.com/blog/mimo-tilert-1000tps

## 摘要

小米和 TileRT 合作，把一个 1 万亿参数的大模型在 8 张普通 GPU 上跑到了每秒生成 1000 多个 token。他们用了两招：一是只对 MoE 专家模块做 FP4 量化，把模型体积和显存带宽压力打下来，同时保住推理质量；二是用了一种叫 DFlash 的投机解码方法，一次能猜对更长的 token 串，减少反复验证的等待时间。目前这个速度只在...

## 推荐理由

小米把一个1万亿参数的MoE模型塞进8张普通GPU，靠FP4量化只压缩专家模块，再配上能一次猜对更长token串的DFlash投机解码，把生成速度拉到每秒1000多个token。这个速度如果是真的挺省钱，但正文没交代测试用的什么卡、上下文多长、精度损失多少，我会先打个折。

## 锐评

这条消息的核心看点不是“快”，而是“用普通GPU跑出专用芯片的速度”。小米和TileRT合作，在8张商品级GPU上让1万亿参数的MiMo-V2.5-Pro跑到每秒超1000 token，没有依赖Cerebras或Groq那种定制硬件。技术路径分两块：模型侧对MoE的专家模块做FP4量化，把体积和显存带宽压力降下来；系统侧用DFlash这种块级投机解码，一次猜更长的token串，减少反复验证的等待。

但信息缺口很明显。正文没给出上下文窗口大小、量化后的精度对比、具体用什么基准测试验证推理质量，也没说明这1000+ tps是在什么输入长度和batch size下测的。宣传页提到API价格是标准版的3倍，声称“3倍价格换10倍生成速度”，这个性价比听着诱人，但没看到延迟分布和并发上限，实际业务里能不能稳定住这个速度还不好说。

另外，试用需要申请，只开放两周，资源有限，说明这还是个早期演示而非成熟产品。想评估它能不能真进高频交易、实时反欺诈这类生产链路，得等他们放出更多技术细节和第三方复现结果。
