# MiniMax 开源 M3 模型：一个模型搞定编程、100 万 token 上下文和原生多模态

> 原标题：MiniMax M3：前沿编码、100万token上下文与原生多模态一体模型

- 来源：AI HOT 精选
- 发布时间：2026-06-01T03:39:41.634Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/30847
- 原文：https://www.minimax.io/blog/minimax-m3

## 摘要

MiniMax 把 M3 模型开源了，权重公开可下载。它把三个能力塞进了一个模型里：编程水平摸到了 GPT-5.5 和 Gemini 3.1 Pro 的边（SWE-Bench Pro 得分 59.0%），能处理 100 万 token 的超长上下文，还原生支持图片和视频输入。长上下文不卡顿的关键是他们自研的 MSA 稀疏注意力机制——在 100 万 t...

## 推荐理由

MiniMax M3开源了一个把文本、图像、音频塞进同一个模型的一体方案，上下文窗口拉到100万token。最实在的点是MSA注意力机制，每token计算成本降到前代的1/20，长文本推理能省不少钱。编码和Agent跑分看着不错，但正文没给出具体对比对象和测试细节，这点先别太激动。整体是一次有诚意的开源发布，信息量够，但验证还缺一环，所以放在featured而不是P1。

## 锐评

M3 是目前第一个把这三样东西打包开源的大模型：编程能力在 SWE-Bench Pro 上拿了 59.0%，比 GPT-5.5 和 Gemini 3.1 Pro 都高一点，但离 Opus 4.7 还差一截。它支持 100 万 token 的上下文窗口，靠的是自研的 MSA 稀疏注意力机制——简单说就是让模型只看该看的部分，而不是把整本“书”逐字读一遍，官方说在 100 万 token 长度下，每个 token 的计算量降到前代模型的 1/20，预填充快 9 倍以上，解码快 15 倍以上。原生多模态这边，能直接吃图片和视频，在文档理解测试 OmniDocBench 上超过了 Gemini 3.1 Pro。

不过这篇博客是厂商自宣，所有跑分都来自他们自己选的基准，没有第三方复现。另外，虽然强调开源权重，但没提模型参数量、推理所需显存，也没给 API 调用价格和实际首 token 延迟，这些对想上手用的人来说比跑分更重要。长上下文在实际业务里是不是真的不卡、多模态能力在复杂场景下稳不稳，都得等社区实测才能下判断。
