# 微软发布自研推理模型MAI-Thinking-1，35B参数在编程和数学上追平Opus 4.6

> 原标题：2026-06-02 群聊日报

- 来源：AI 群聊日报
- 发布时间：2026-06-03T07:19:29.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/34273
- 原文：https://louyu2015.github.io/AI-chatgroup-daily/daily/2026/06/02/daily/

## 摘要

微软首个正式对外发布的自研推理模型MAI-Thinking-1，用了35B活跃参数、总参数约1T的稀疏MoE架构。SWE-Bench Pro编程测试跟Claude Opus 4.6打平，AIME 2025数学测试拿到97%，盲测里人类偏好优于Sonnet 4.6。训练全程没用任何第三方模型蒸馏，预训练数据也排除了AI生成内容。不过群友对微软年底拿第一的...

## 推荐理由

这条消息的钩子很清晰：微软的 MAI-Thinking-1 在代码基准上追平了 Opus 4.6，而且给出了具体的参数规模和数学测试得分。我会先打个折——来源是群聊日报，不是官方公告，正文没披露模型是否开源、API 定价和完整评测设置，所以权威性偏弱。但 H/K/R 三个维度都踩中了：有竞争对标、有硬数字、有平台格局的冲击力。综合来看，值得作为 featured 推给从业者看一眼，但别急着把它当正式发布。

## 锐评

微软这次发布的MAI-Thinking-1，35B活跃参数、总参数约1T的MoE架构，SWE-Bench Pro编程测试跟Claude Opus 4.6打平，AIME 2025数学测试拿到97%，盲测里人类偏好优于Sonnet 4.6。训练全程没用任何第三方模型蒸馏，预训练数据也排除了AI生成内容——这点挺硬气，说明能力确实是靠自己练出来的，不是靠抄别人模型答案。

不过群友对微软年底拿第一的9%概率直接批了个0%，这判断背后有道理：35B活跃参数能打出这个成绩确实强，但Opus 4.6已经是几个月前的模型了，追平不等于超越。而且微软之前发的MAI-Code-1-Flash只有5B参数，在GacUI任务上实测翻车，说明小模型在复杂工程任务上还有明显短板。正文没披露MAI-Thinking-1的推理成本和延迟，这两个指标对实际可用性影响很大。

另外Opus 4.8的工具调用退化bug值得留意——模型会把XML tool call直接输出成文本，一旦发生就回不去，只能抛弃上下文重开。这说明即使头部模型，在让模型进业务流程干活这件事上，稳定性还是个大问题。
