# 小米把 1 万亿参数的 MiMo-V2.5-Pro 开源了，但自己跑真的划算吗？

> 原标题：The Trillion-Parameter Dilemma: MiMo-V2.5-Pro went open-source (1.02T params). Is self-hosting worth it when the API costs $70 for 387M tokens?

- 来源：r/LocalLLaMA
- 发布时间：2026-05-13T08:31:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/19834
- 原文：https://www.reddit.com/r/LocalLLaMA/comments/1tbtinr/the_trillionparameter_dilemma_mimov25pro_went/

## 摘要

小米放出了 MiMo-V2.5-Pro，参数总量 1.02 万亿，但每次推理只激活 420 亿参数，上下文窗口能塞进 100 万个 token，用 MIT 许可证。作者拿它跑了 125 次 Claude Code 任务，走 API 总共花了 70.12 美元，处理了约 3.87 亿个 token，缓存命中率高达 96.3%。这个命中率说明大部分请求其实...

## 推荐理由

我会先打个折：正文没披露 MiMo-V2.5-Pro 的评测跑分，所以性能好坏只能靠参数规模猜。但这条信息本身够直接——小米把一个 1.02 万亿参数、42B 激活的模型开源，另一边作者用 Claude Code 跑了 125 次会话，3.87 亿 token 花了 70.12 美元，缓存命中率 96.3%。这两组数字摆在一起，自建成本和 API 开销的对比就出来了。对做工程的人，这种一手成本数据比技术报告更有参考价值。

## 锐评

小米把 MiMo-V2.5-Pro 开源了，参数总量 1.02 万亿，但每次推理只激活 420 亿个参数，上下文窗口能塞进 100 万个 token，用 MIT 许可证。作者拿它跑了 125 次 Claude Code 任务，走 API 总共花了 70.12 美元，处理了约 3.87 亿个 token，缓存命中率高达 96.3%。这个命中率说明大部分请求其实是在重复处理相似内容，API 端靠缓存省了大量计算，但你自己部署时，这些重复计算都得实打实跑在显卡上，成本会高很多。

文章没给出自部署的硬件需求和具体成本估算，也没说这 125 次任务的成功率和效果如何。70 美元跑 3.87 亿 token 听起来不贵，但如果你要自己搭服务器，光显卡钱可能就够买好几年的 API 额度了。这点先别太激动，等有人测出本地部署的真实开销再说。
