# 小米 MiMo 1T 模型跑出每秒超 1000 token，靠混合量化和并行解码把速度提了 10 倍

> 原标题：小米 MiMo 与 TileRT 联合发布 UltraSpeed 模式，1T 模型输出突破 1000 tokens/s

- 来源：AI HOT 精选
- 发布时间：2026-06-09T03:31:32.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/35718
- 原文：https://mp.weixin.qq.com/s/EZvmrx8xfM9MZNCMDwImFQ

## 摘要

小米 MiMo 和 TileRT 给 1T 参数旗舰模型加了个 UltraSpeed 模式，输出速度首次超过 1000 tokens/s。模型这边用了 FP4 混合量化，只量化 MoE 的 Expert 部分，搭配 DFlash 的块级 masked 并行推测解码，coding 场景下平均一次能接受 6.30 个 token，相当于猜对的命中率不低。系...

## 推荐理由

我会先打个折：正文没提硬件配置、batch size、并发数，也没说测试用的 prompt 长度和具体环境，所以这个 1000 tokens/s 的绝对值先别太激动。但亮点是技术组合说得清楚——FP4 只量化 MoE 的 Expert 部分，不是全模型瞎压，搭配 DFlash 的块级 masked 并行推测解码，coding 场景下一次能猜对 6.30 个 token，命中率不低，说明这套方案在代码生成这种结构化输出上确实有效。小米给旗舰模型开 UltraSpeed 模式，还定了三倍 Pro 版的价格，摆明了是要在推理速度和 API 商业化上抢个身...

## 锐评

这条消息的核心是快：一个万亿参数模型跑出每秒超1000个token，比原版快约10倍。快在哪？模型这边用了FP4混合量化，只压缩MoE的专家部分，没动其他结构；再用DFlash的块级并行推测解码，在写代码场景下平均一次能接受6.30个token，说明猜得挺准，不是瞎蒙。系统侧TileRT搞了常驻内核引擎和异构流水线，把推理延迟压下去。

但别急着喊便宜。API定价是原版MiMo-V2.5-Pro的3倍，速度换时间，不是省钱方案。而且限时开放到6月23日，更像技术秀肌肉，不是稳定服务。FP4权重和DFlash checkpoint已经开源到HuggingFace，想自己部署的可以试试，但正文没提硬件门槛和实际部署成本，这点得自己掂量。

还缺什么？没看到通用场景下的接受长度数据，只有coding场景的6.30。其他任务能不能保持这个命中率，不知道。也没提首token延迟，光说吞吐量，实际体验可能还要看响应速度。
