# MiniMax 开源 M3 模型，428B 总参数里只激活 23B，长文本推理更省钱

> 原标题：MiniMax 开源 M3 模型权重及 MSA 技术论文

- 来源：AI HOT 精选
- 发布时间：2026-06-15T14:40:02.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/38426
- 原文：https://mp.weixin.qq.com/s/AW6L89QZkwN-jD27hQ84ww

## 摘要

MiniMax 把 M3 模型权重放出来了，总参数 428B，每次推理只激活 23B，同时发了 MSA 稀疏注意力论文，专门降长上下文推理成本。M3 是第一个从预训练阶段就用图文交错数据练出来的开源模型。发布两周后，它在 Artificial Analysis 综合智能指数和 GDPval-AA 上拿了开源第一，Code Arena WebDev 进了...

## 推荐理由

MiniMax 把 428B 的 M3 模型权重和 MSA 稀疏注意力论文一起放出来，主打长上下文推理省钱，两周内拿了两个开源第一。我会先打个折，因为这是官方公告，没有第三方基准或具体的 MSA 成本数字，但架构稀缺性和开源排名已经够上 featured。

## 锐评

M3 这次开源有两个值得看的点：一是 428B 总参数但每次推理只激活 23B，这种“大模型小用”的设计直接冲着省钱去的，配合 MSA 稀疏注意力，长上下文推理成本能压下来。二是它从预训练阶段就用图文交错数据练，不是事后补多模态，这点在开源模型里算少见。

发布两周后，它在 Artificial Analysis 综合智能指数和 GDPval-AA 上拿了开源第一，Code Arena WebDev 进了帕累托最优，Vals.AI 排国产模型首位。输出速度从约 30 TPS 提到约 80 TPS，还计划再提 30-40%，对实际用的人来说体验会好不少。

不过正文没披露这些榜单的具体分数、对比了哪些模型、测试条件是什么，也没说 MSA 在多大上下文长度下能省多少成本。这些信息缺口让“第一”的含金量不好判断，我会先打个折。另外，Token Plan 后台加了调用量看板，说明他们也在推商业化，但定价和实际成本结构还没公开。
