# 微软放出 MAI-Thinking-1，35B 活跃参数的 MoE 模型，没靠蒸馏自己从头训

> 原标题：微软发布 MAI-Thinking-1 模型

- 来源：AI HOT 精选
- 发布时间：2026-06-02T20:51:03.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/32930
- 原文：https://x.com/rohanpaul_ai/status/2061913509399789924

## 摘要

微软发了 MAI-Thinking-1，一个混合专家（MoE）模型，总参数 1 万亿但每次只激活 350 亿，跑起来相对省算力。它用 30T token 从零预训练，没拿第三方模型做蒸馏，这点比较硬气。微软管自己的迭代优化流程叫“爬山机器”，听着像在反复试错往上拱。成绩单上，AIME 2025 拿了 97.0%，LiveCodeBench v6 拿了 ...

## 推荐理由

微软发了 MAI-Thinking-1，一个 MoE 架构的推理模型，活跃参数 35B，总参数 1T，用 30T tokens 从零开始预训练。我会先打个折：正文没给任何跑分、开放方式或定价，所以没法判断实际水平。光看参数规模，35B 活跃部分在推理时成本不会太高，但 1T 总参数意味着训练和存储都不便宜。这点先别太激动，等有 benchmark 和访问方式再说。

## 锐评

MAI-Thinking-1 是微软从零预训练的大模型，总参数1万亿，但用混合专家架构把每次实际激活的参数压到350亿，推理成本会比同体量密集模型低不少。30T token的训练量不算小，而且明确说没拿第三方模型做蒸馏，这在现在到处互相蒸馏的环境里确实少见，说明微软在底层训练能力上还是想自己走一条路。

成绩单上，AIME 2025数学题做到97%，LiveCodeBench v6编程题87.7%，这两个数字挺好看。但SWE-Bench Pro只有52.8%，这个测试更接近真实软件工程任务，说明模型在复杂、多步骤的实际开发场景里还有明显短板。微软管自己的优化流程叫“爬山机器”，听着像在反复试错往上拱，但正文没披露具体怎么个爬法、用了多少算力、迭代了多少轮。

还缺几个关键信息：训练成本没提，推理延迟没给，跟同期的GPT-5或Claude 4对比也没做。另外30T token的数据构成是什么、有没有中文能力，这些都没说。所以现在只能把它当成微软在推理模型上的一次实力展示，离“能直接干活”还有距离。
