# 微软 MAI-Code-1-Flash 用 50 亿活跃参数在 SWE-Bench Pro 上拿到 51% 的分数

> 原标题：Microsoft's MAI-Code-1-Flash Scores 51% SWE-Bench Pro with Just 5B Active Params

- 来源：Hacker News 首页
- 发布时间：2026-06-02T18:47:07.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/32910
- 原文：https://microsoft.ai/models/mai-code-1-flash/

## 摘要

微软新放出的 MAI-Code-1-Flash 是个代码模型，只激活 50 亿参数就在 SWE-Bench Pro（一个让模型修真实 GitHub 问题的测试集）上跑出 51% 的分数。这个成绩放在小模型里算亮眼，但正文没披露它是在什么评测设定下跑的、用了哪些训练数据、什么时候发布，也没说部署条件。所以这个 51% 我先打个折看——不知道是不是挑过题、...

## 推荐理由

HKR 三条都过，靠的是微软这个 5B 活跃参数拿 51% SWE-Bench Pro 的说法。但正文没披露评测设置、训练数据和发布时间，信息缺口明显，分数只能压在 72–77 这个区间。

## 锐评

微软放出的 MAI-Code-1-Flash 是个代码模型，只激活 50 亿参数就在 SWE-Bench Pro（一个让模型修真实 GitHub 问题的测试集）上跑出 51% 的分数。这个成绩放在小模型里算亮眼，但正文没披露它是在什么评测设定下跑的、用了哪些训练数据、什么时候发布，也没说部署条件。所以这个 51% 我先打个折看——不知道是不是挑过题、有没有用额外的工具辅助，或者测试环境跟别人不一样。

SWE-Bench Pro 本身是个比较硬的代码修复基准，能过一半说明模型在理解 issue、定位代码、生成补丁这条链路上有一定能力。但光一个数字不够，还得看它修的是哪些类型的 bug、修复质量怎么样、有没有反复提交才通过。这些信息目前都缺。

另外，模型只激活 50 亿参数意味着推理成本可能比较低，适合本地跑或者批量处理。但正文完全没提内存占用、推理速度、是否开源、能不能商用，这些才是决定它能不能真用起来的关键。等微软把技术报告或者模型权重放出来再判断不迟。
