# MiniMax 发布第三代视频模型 H3，开源权重，能直接生成带立体声的 2K 视频，ComfyUI 当天就接入了

> 原标题：MiniMax H3 Day-0 Support in ComfyUI: Open Weights, Native Audio, and 2K Video

- 来源：Hacker News 首页
- 发布时间：2026-08-03T13:34:43.000Z
- AX AI 日报：https://ai-daily.ax0x.ai/items/48444
- 原文：https://blog.comfy.org/p/minimax-h3-day-0-support-in-comfyui

## 摘要

MiniMax 今天把 H3 模型的权重开源了，这是他们第三代视频模型，之前两代叫 Hailuo 01 和 02。H3 能根据文字、图片、视频或音频直接生成最长 15 秒、分辨率到 2K 的视频，而且音频是跟画面一起生成的立体声，不是后期贴上去的。它把文生视频、图生视频、首尾帧控制、动作迁移这些功能合在一个模型里了。动作迁移比较实用，你可以拿一段参考视...

## 推荐理由

这是 MiniMax 第一次把视频模型开源，而且上来就给权重、给 ComfyUI 节点，姿态比之前开放不少。我会先打个折，因为目前只有官方博客和社区适配信息，没有第三方跑分或画质对比，实际生成质量和硬件门槛还不清楚。正文没披露训练数据规模和具体推理成本，所以先当一条高关注度的开放动态来处理，分数卡在 82。

## 锐评

H3 是 MiniMax 的第三代视频模型，今天把模型权重放出来了，ComfyUI 也给了首日支持。它把文生视频、图生视频、首尾帧控制、动作迁移这些功能合在一个模型里，不用来回切工具。比较实用的是动作迁移：你可以拿一段参考视频提供运镜或动作，主体和风格用别的素材，适合做镜头迭代。

输出规格是 2K、最长 15 秒，音频是跟画面一起生成的立体声，不是后期贴上去的。官方博客说能在一张 3060 上本地跑，但正文没给出具体显存占用、生成速度和分辨率下的实际表现，这个性能数字得等社区跑分出来再看。

目前缺的是跟其他开源视频模型（比如 CogVideoX 或 Mochi 1）在画质一致性、动作幅度和长视频连贯性上的横向对比。另外，多模态输入（同时喂图、视频、音频）的混合效果，博客只给了两个示例，覆盖面不够，实际可控性还得自己上手试。
