# MiniMax 发布开源模型 H3，能直接生成带原生立体声的 2K 视频

> 原标题：MiniMax H3 发布：开源全能多模态生成模型，支持 2K 原生立体声视频

- 来源：AI HOT 精选
- 发布时间：2026-07-31T09:59:02.996Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/47835
- 原文：https://www.minimax.io/blog/minimax-h3

## 摘要

MiniMax 推出了一个叫 H3 的多模态生成模型，把文字、图片、视频和音频的理解都塞进了一个模型里。它能直接生成最长 15 秒、带原生立体声的 2K 视频。公司给出的价格挺有竞争力：2K 视频每秒的价格不到主流模型的三分之一，768p 的价格也比主流 720p 便宜一半以上。模型权重计划在几天内开源，但公告没提具体用哪种开源协议，也没说确切日期，只...

## 推荐理由

MiniMax 发了 H3，一个把文、图、视频、音频塞进同一个模型的多模态生成模型，能直接出最长 15 秒、带原生立体声的 2K 视频。定价上，2K 每秒不到主流模型的三分之一，768p 也比主流 720p 便宜一半以上，省钱信号很明确。权重计划几天内开源，但公告没写具体协议和确切日期，这点先别太激动。整体看，一个模型打通多模态生成，加上激进定价和开源动作，对做视频生成的人来说是值得马上看一眼的更新。

## 锐评

MiniMax H3 这次最狠的一手是把价格压得很低：2K 视频每秒不到主流模型的三分之一，768p 也比主流 720p 便宜一半以上。这对做广告、电商视频的人来说，试错成本会降不少。技术上它把文字、图片、视频、音频的理解都做进一个模型里，比如你可以给它一段参考视频、一张图和一段音频，让它照着希区柯克的运镜、让图里的人唱音频里的歌，它自己搞定跨模态的理解。这比之前需要分别调不同模型再拼起来要省事。

不过公告里关键信息缺得有点多。说“几天内”开源模型权重，但没写具体哪天，也没提用哪种开源协议——是 Apache 2.0 还是带限制的自定义协议，对想商用的人来说差别很大。另外，15 秒 2K 视频在实际场景里够不够用、生成速度怎么样、复杂指令下的翻车率有多高，正文都没给数据。价格便宜是好事，但得等权重真放出来、有人跑过实测，才知道这三分之一的价格是不是真的三分之一的效果。
