小米发布 MiMo-V2.5-Pro-UltraSpeed,万亿参数模型跑到每秒 1000 个 token
小米和 TileRT 合作,把一个 1 万亿参数的大模型在 8 张普通 GPU 上跑到了每秒生成 1000 多个 token。他们用了两招:一是只对 MoE 专家模块做 FP4 量化,把模型体积和显存带宽压力打下来,同时保住推理质量;二是用了一种叫 DFlash 的投机解码方法,一次能猜对更长的 token 串,减少反复验证的等待时间。目前这个速度只在...
推荐理由:小米把一个1万亿参数的MoE模型塞进8张普通GPU,靠FP4量化只压缩专家模块,再配上能一次猜对更长token串的DFlash投机解码,把生成速度拉到每秒1000多个token。这个速度如果是真的挺省钱,但正文没交代测试用的什么卡、上下文多长、精度损失多少,我会先打个折。