# 小米开源 MiMo-V2.5-Pro，写代码的跑分紧挨着 Claude Opus 4.6

> 原标题：Xiaomi releases MiMo-v2.5 Family weights with strong coding and agent benchmarks

- 来源：Hacker News 首页
- 发布时间：2026-04-28T12:16:25.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/11204
- 原文：https://firethering.com/mimo-v2-5-pro-xiaomi-coding-model/

## 摘要

小米把 MiMo-V2.5-Pro 的模型权重放出来了。标题说它的编程能力在跑分上和 Claude Opus 4.6 差不多，文章举了个例子：北大计算机系的编译器大作业，学生通常要花几周，这个模型 4.3 小时跑完，233 个隐藏测试全过。V2.5-Pro 相比之前的 Flash 版，主要提升了长任务连贯性、能处理超过一千步的复杂任务，以及让模型进业务...

## 推荐理由

HKR 三项都通过，因为小米发编程/Agent 权重本身是实打实的动作，从业者会想看一眼。但信息缺口很大：没参数、没许可、没具体分数，只有标题说表现突出，所以我会先打个折，重要性停在 74 分 featured 门槛附近。

## 锐评

小米放出了 MiMo-V2.5-Pro 的权重，主打编程和让模型进业务流程干活的能力。文章举了个挺具体的例子：北大计算机系的编译器大作业，学生通常要花几周，这个模型 4.3 小时跑完，233 个隐藏测试全过。相比之前的 Flash 版，V2.5-Pro 主要提升了长任务的连贯性，能处理超过一千步的复杂任务。

但文章的信息缺口也很明显。标题说跑分跟 Claude Opus 4.6 差不多，正文却没给出任何具体分数、测试集名称或对比条件。模型参数量、上下文窗口、硬件要求和开源协议也都没提。光靠一个编译器作业的案例，很难判断它在其他编程场景下的泛化能力。

想认真评估的话，还得等小米官方放技术报告，或者社区在 HumanEval、SWE-bench 这类标准测试上跑一遍。目前能说的是：小米在开源编程模型上确实在发力，但具体强到什么程度，得等更多数据。
