# MiniMax 发布 H3 开源多模态模型，能直接生成带立体声的 2K 视频

> 原标题：MiniMax H3

- 来源：Product Hunt · AI
- 发布时间：2026-07-31T03:17:18.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48025
- 原文：https://www.producthunt.com/products/minimax

## 摘要

MiniMax 在 Product Hunt 上发布了 H3，一个开源的多模态视频生成模型。它能把文字、图片和音频拼在一起，直接输出带原生立体声的 2K 视频。H3 主打商业内容制作，比如动态设计和品牌包装，强项是准确渲染文字、做视觉包装和理解复杂指令。不过正文没披露参数量、推理延迟和具体的开源协议，所以它自称的“世界领先”先别太当真，等技术报告出来再说。

## 推荐理由

MiniMax 在 Product Hunt 发了 H3，一个开源多模态视频模型，能把文字、图片和音频拼在一起出 2K 立体声视频，主打商业内容制作，文字渲染和视觉包装是它自己强调的强项。但正文没披露参数量、推理延迟和具体开源协议，所以“世界领先”这个说法我会先打个折，等技术报告出来再看。

## 锐评

MiniMax 在 Product Hunt 上线的 H3 是一个多模态视频生成模型，把文字、图片和音频拼在一起，能直接输出带原生立体声的 2K 视频。它主攻商业内容制作，比如动态设计和品牌包装，官方强调强项是准确渲染文字、做视觉包装和理解复杂指令。

但这条发布信息缺的东西比给的东西多。正文没披露模型参数量，不知道是大模型硬扛还是小模型取巧；没提推理延迟，跑一条片子要等多久完全没数；开源协议也只字未提，是 Apache 2.0 还是只给权重自己看着办，这会直接影响能不能商用。另外，Product Hunt 上只有 4 条评价，样本太少，参考价值有限。

“世界领先”这个说法目前没有技术报告或第三方基准测试支撑，先别太当真。如果后续放出详细的技术指标和实际跑分，才能判断它到底省不省钱、好不好用。
