
但这次 MiniMax 开源的 H3,确实让我有点意外。
它可能是我到目前为止用过的 最可控 的 AI 视频模型之一。让我印象最深的不是画面有多电影感,而是它能把文本、图像、视频、音频、角色参考、镜头运动,甚至语音克隆,全部塞进同一套工作流里跑。你要做广告片、音乐视频、品牌素材,还是游戏过场动画,这种控制精度确实是往前跨了一大步。
一、H3 到底是个什么东西
先花两分钟说清楚它的定位,不然后面下载模型你会一脸懵。
H3 是 MiniMax 在 8 月 3 日正式开源的 全模态生成系统 ,不是单纯的”文生视频”模型。官方的说法是它能统一理解由文本、图像、视频、音频构成的多模态上下文,然后直接生成带 原生立体声 的视频。

几个关键能力:
- 输出时长 4 到 15 秒,最高 2K 分辨率
- 视频和音频是 同步生成 的,32kHz 立体声,不是后期贴上去的
- 支持中、英、日、韩、法等 11 种语言的口型和语音
- 在 Artificial Analysis 榜单里,H3 的 视频编辑能力排名全球第一 ,文生视频和图生视频分列第二、第三
它是海螺 AI 上线以来的第三代视频模型,架构换成了 H3-Context-IR,跟 Hailuo 01、Hailuo 02 完全不是一套东西。
关键是它的越狱版已经在网上公布,相比官方版它更自由,更没有内容限制

二、显存到底要多少(这段请认真看)
网上现在满天飞”8G 显存也能跑”,我把目前能查到的公开实测数据整理一下,你自己判断:
已有稳定跑通记录的配置 :12G 显存 + 32G 系统内存 + 高速固态。实测生成 5 秒 480p 视频,20 步,接近 5 分钟。
官方未量化版的公开验证配置 :两张卡各 32G 显存(合计 64G),系统内存约 384G。生成 5 秒 1344×768 视频,50 步,约 9.3 分钟。
为什么 12G 显存能跑得动 40 多 G 的模型?因为 ComfyUI 用的是 按层动态调度 :需要哪一层就把哪一层搬进显存,其余的留在内存和硬盘里。所以显存不够并不会直接报错,只会变慢。
那 8G 能不能跑?能,但要靠更激进的量化(Q2、Q3)加上大量 offload,出片时间会明显拉长,而且低量化对画质的损伤是实打实的。 如果你是 8G 卡,我的建议是:系统内存一定要 32G 起步,硬盘必须是 NVMe 固态,然后从 480p、20 步、5 秒开始试,别一上来就冲 720p。
三、开始部署
第一步:升级 ComfyUI
这一步跳过的话后面全是坑。H3 需要 ComfyUI 0.27 或更高版本 ,老版本没有对应的原生节点。
ComfyUI 最新版下载
1、、官方下载:【点击前往】
2、备用下载:【点击前往】,含越狱工作流及节点
如果你之前已经安装过 ComfyUI 桌面版 ,那么务必将其升级到最新版,否则你是看不到 MiniMax H3 开源模型的

用整合包的朋友,直接用启动器里的”更新”功能更新到最新版本。更新完启动一次,在右下角确认版本号。
第二步:选择模型
目前在模板中心,有3种不同的 MiniMax H3 开源模型,分别是:文生视频、图生视频、视频转视频

这里大家可以根据自己的喜好进行下载,生成的视频分辨率建议设置小点,可以大大提升生成速度,等生成完成以后,可以通过下方这款首批高清放大工具,将视频提升到1080、2K、甚至是4K画质!
视频高清放大工具: 【网盘下载 】或【备用下载】
第三步:越狱模型
1、hugging face下载: 【 点击前往 】
2、备用整合包下载 :【 点击前往 】

越狱模型有3个,47.97G 是 BF16 满血版,对显存要求比较高,家用消费级显卡建议选择更小的量化模型,比如里面的24.55G的。实测效果也非常不错!
第四步:越狱模型工作流
1、越狱工作流节点:【 点击下载 】或 【 网盘下载 】、【 备用下载 】

更小的 MiniMax-H3-NVFP4 量化版,(适合8G显存)
1、Huggingface 下载: 【 点击前往 】
2、备用整合包下载: 【 点击前往 】
模型介绍
| 类型 | 文件 | 放置目录 |
|---|---|---|
| 主模型 | MiniMax-H3-FL2VA-Q4_K_M.gguf(按显存选量化) | models/unet/ |
| 文本编码器 | qwen3vl_32b_minimax_h3_Q4_K_M.gguf | models/text_encoders/ |
| 视频 VAE | minimax_h3_video_vae_fp16.safetensors | models/vae/ |
| 音频 VAE | minimax_h3_audio_vae_fp32.safetensors | models/vae/ |
量化版本怎么选:
- 24G 及以上:Q8 或官方 INT8 / NVFP4
- 16G:Q5 或 Q4
- 12G:Q4
- 8G:Q3,或者混合精度的 Q2 版本
注意一个细节: 音频 VAE 必须是 fp32 版本 ,用 fp16 的会出现音画不同步或者干脆没声音。这个坑我踩过。
如果你走的是官方原生路线,模型权重需要 同时 放在 models/MiniMax-H3/ (单文件权重)和 models/diffusers/MiniMax-H3/ (分片版本,含 config.json)两个目录,缺一个都会报错。这个设计有点反直觉,但目前就是这样。
第四步:加载工作流
GGUF 的模型仓库里一般会附带对应的工作流 JSON 文件(类似 MiniMax FL2V GGUF (WORKFLOW).json ),下载下来直接拖进 ComfyUI 界面就能加载。
官方原生路线的话,ComfyUI 的模板浏览器里已经内置了 H3 的官方工作流,直接选就行。
加载后检查这几个节点:
1. Unet Loader (GGUF) :选你下载的主模型 2. CLIP Loader (GGUF) :选 qwen3vl 文本编码器 3. VAE Loader :注意有两个,视频 VAE 和音频 VAE 分别对应,别接反 4. 分辨率和帧数 :第一次跑先设 480p、5 秒
节点全部变绿没有报红,就可以点生成了。
第五步:第一次生成
第一次跑会很慢,因为要把权重从硬盘加载进来。8G 到 12G 显存的机器,5 秒 480p 视频 20 步,做好等 8 到 15 分钟的心理准备。
第二次开始会快很多 ,因为一部分权重已经缓存在内存里了。
四、实测体验:怎么把片子拍好看
跑通只是开始,真正决定出片质量的是提示词。H3 跟以前那些模型不一样,它是 真的能听懂镜头语言 的。
提示词要写”分镜”,不要写”标签”
以前玩 SD 那套”关键词堆砌”在 H3 上效果很一般。H3 更吃 完整的场景描述加镜头调度 。
不好的写法:
<code class="language-js">一个女人,咖啡馆,下雨,电影感,8k,高质量</code>
好的写法:
<code class="language-js">黄昏的咖啡馆靠窗位置,窗外下着小雨。一位穿米色针织衫的女性 正低头搅拌咖啡,镜头从她的手部特写缓慢上摇至面部,她抬头看 向窗外,嘴角微微上扬。暖色调室内灯光,窗外冷色调环境光形成 对比。背景音:雨声、咖啡杯轻碰声、隐约的爵士乐。</code>
区别在于: 第二种把画面、动作、镜头运动、光线、声音全部交代清楚了 。H3 的音频是跟画面一起生成的,你不写声音,它就自己猜,猜出来的十有八九不是你要的。
镜头运动直接用术语
推、拉、摇、移、跟、升降,这些术语 H3 都认。也可以写英文的 dolly in、pan left、crane shot、handheld。想要稳定的运镜就写明白,别指望它读心。
角色一致性靠 Ref2VA
这是 H3 最实用的功能,没有之一。
用 Ref2VA 分区,喂进去同一个角色的多张参考图(最多 9 张,建议 3 到 5 张不同角度的),再配一段语音参考,就能做出 跨镜头同一个人、同一个声音 的连续片段。做口播、做系列内容、做虚拟主播,这个能力直接把工作量砍掉一大半。
实测下来,参考图的质量比数量重要得多。5 张清晰的正侧面照,效果远好过 9 张糊图。
15 秒不够用怎么办
单次最长 15 秒是硬限制。想做长片就用 尾帧接首帧 的方式串:第一段的最后一帧导出,作为第二段的首帧输入,配合 Ref2VA 锁角色,就能做出连贯的多镜头。社区已经有人做出 30 秒三镜头、人物和声音全程一致的片子了。
五、常见问题排查
报错找不到节点 :ComfyUI 版本太老,或者没装 ComfyUI-GGUF。
加载模型时爆显存直接崩溃 :换更低的量化版本,同时在启动参数里加 --lowvram 。
生成出来没有声音 :检查音频 VAE 是不是用了 fp16 版本,必须用 fp32。
画面有了但音画不同步 :多半是视频 VAE 和音频 VAE 接反了,回到工作流检查连线。
速度慢到无法接受 :先确认模型文件在固态硬盘上,机械硬盘会让 offload 的速度慢十倍。再确认系统内存够不够,内存不够会走虚拟内存,那就更慢了。
画面崩坏、人物变形 :多半是量化太狠。Q2、Q3 这种级别的画质损伤是客观存在的,不是提示词能救回来的。这种情况要么加显存,要么降分辨率换质量。
总结
H3 这次开源的意义,我觉得不在于”又多了一个能跑的模型”,而在于 开源视频模型第一次在可控性上追平了闭源产品 。
音画同步生成、角色跨镜头一致、镜头语言可控、11 种语言口型,这些能力放在半年前还是闭源产品的护城河,现在权重就在你硬盘里。
配置门槛确实还在。12G 显存是目前比较舒服的起点,8G 能跑但需要耐心。但考虑到这才是开源第一周,量化方案和推理优化的迭代速度一向很快,再过一两个月的情况大概率会更好。
想玩的现在就可以动手了。有问题欢迎在评论区交流,我看到都会回。
本文整理自零度博客,原文链接: https://www.freedidi.com/25010.html
