跳到正文
Product Hunt · AI

MiniMax 发布 H3 开源多模态模型,能直接生成带立体声的 2K 视频

MiniMax H3

MiniMax 在 Product Hunt 上发布了 H3,一个开源的多模态视频生成模型。它能把文字、图片和音频拼在一起,直接输出带原生立体声的 2K 视频。H3 主打商业内容制作,比如动态设计和品牌包装,强项是准确渲染文字、做视觉包装和理解复杂指令。不过正文没披露参数量、推理延迟和具体的开源协议,所以它自称的“世界领先”先别太当真,等技术报告出来再说。

推荐理由:MiniMax 在 Product Hunt 发了 H3,一个开源多模态视频模型,能把文字、图片和音频拼在一起出 2K 立体声视频,主打商业内容制作,文字渲染和视觉包装是它自己强调的强项。但正文没披露参数量、推理延迟和具体开源协议,所以“世界领先”这个说法我会先打个折,等技术报告出来再看。

读原文 ↗导出 Markdown