MiniMax H3 强袭开源教程

MiniMax H3 正式开源:最低 8G 显存也能跑?我把部署和实测坑位都踩了一遍

这两年我折腾过的开源视频模型不算少,老实讲大部分最后都被我删了。

原因通常就俩:

  • 模型太大:普通电脑根本跑不动
  • 能跑起来:画面一言难尽,人物一动就崩;声音还得自己后期配

但这次 MiniMax 开源的 H3,确实让我有点意外:它不是“画面多电影感”那种单点强,而是可控性做得很完整——文本、图像、视频、音频、角色参考、镜头运动,甚至语音克隆,都能塞进同一套工作流里跑。

如果你想做广告片、音乐视频、品牌素材、游戏过场动画,这种控制精度,属于“开源往前迈了一大步”。


一、H3 到底是什么?(先把定位讲清楚)

H3 是 MiniMax 在 8 月 3 日正式开源的 全模态生成系统,不只是“文生视频”。

官方描述是:它能统一理解由 文本 / 图像 / 视频 / 音频构成的多模态上下文,然后直接生成带原生立体声的视频。

我把文章里最关键的能力点整理成一张清单(方便你快速判断值不值得折腾):

  • 输出时长:4–15 秒
  • 分辨率:最高 2K
  • 音画:同步生成(32kHz 立体声),不是后期贴音轨
  • 口型与语音:支持中、英、日、韩、法等 11 种语言
  • 榜单表现:Artificial Analysis 上,H3 的视频编辑能力排名第一;文生视频、图生视频分别位列第二、第三(原文描述)

另外一点:它是海螺 AI(Hailuo)体系的第三代视频模型,架构换成了 H3-Context-IR,和 Hailuo 01/02 不是一套东西。

image.png

原文里还提到“越狱版已公布,限制更少”。这类内容我建议大家自行评估合规与风险,本文重点放在部署与跑通。

image.png

二、显存到底要多少?(这段请认真看)

网上现在满天飞“8G 显存也能跑”。我把原文里提到的公开实测/验证配置,按“能稳定跑通”到“官方验证”梳理一下,你自己判断期望值:

1)已有稳定跑通记录(相对现实)

  • 12G 显存 + 32G 内存 + 高速固态(NVMe 更稳)
  • 实测:生成 5 秒 480p,20 步,接近 5 分钟

2)官方未量化版本的公开验证(离家用较远)

  • 双卡:每张 32G 显存(合计 64G)
  • 系统内存约 384G
  • 生成:5 秒 1344×768,50 步,约 9.3 分钟

3)为什么 12G 能跑动 40G+ 的模型?

核心原因是 ComfyUI 的 按层动态调度(offload):需要哪一层就把哪一层搬进显存,其余留在内存和硬盘里。

所以显存不够一般不会直接报错——它会变慢。

4)那 8G 能不能跑?

能,但得靠更激进的量化(Q2/Q3)+ 大量 offload,出片时间会明显拉长,且低量化对画质的损伤是客观存在的。

如果你是 8G 卡,我给个“更像能跑通”的起手式(原文建议):

  • 内存:32G 起步
  • 硬盘:NVMe 固态
  • 参数:从 480p / 20 步 / 5 秒开始
  • 别上来就冲 720p,更别说 2K

三、开始部署(按这个顺序来,少踩坑)

第一步:升级 ComfyUI(必须)

H3 需要 ComfyUI 0.27 或更高版本,老版本没有对应的原生节点。

如果你之前装的是 ComfyUI 桌面版,务必升级到最新版;用整合包/启动器的,就用“更新”功能更新,然后启动一次在右下角确认版本号。

第二步:选择模型类型

原文提到模板中心有 3 种开源模型方向:

  • 文生视频
  • 图生视频
  • 视频转视频
image.png

建议你先把分辨率设小一点,先跑通再说;等生成完成后再考虑放大到 1080p/2K/4K。

原文提供的“视频高清放大工具”下载:

image.png

第三步:关于“越狱模型”(按需)

原文提供的下载入口如下(我原样保留链接):

原文说越狱模型有 3 个版本,其中 47.97G BF16 满血版更吃显存;消费级建议选更小的量化模型(如 24.55G 量化版)。

另有一个更小的量化版(原文标注“适合 8G 显存”):

第四步:工作流与节点(建议直接用现成的)


四、模型文件放置目录(别放错,不然必报错)

原文给了一个很关键的“类型—目录”表,我这里用清单方式复述(路径原样保留):

模型介绍

类型 文件 放置目录
主模型 MiniMax-H3-FL2VA-Q4_K_M.gguf(按显存选量化) models/unet/
文本编码器 qwen3vl_32b_minimax_h3_Q4_K_M.gguf models/text_encoders/
视频 VAE minimax_h3_video_vae_fp16.safetensors models/vae/
音频 VAE minimax_h3_audio_vae_fp32.safetensors models/vae/

量化版本怎么选(原文建议)

  • 24G 及以上:Q8 或官方 INT8 / NVFP4
  • 16G:Q5 或 Q4
  • 12G:Q4
  • 8G:Q3,或混合精度 Q2

重要坑位(请划重点):音频 VAE 必须是 fp32。

用 fp16 容易出现音画不同步,甚至没声音(原文踩坑提示)。

另外,走官方原生路线的同学注意:权重需要同时放在两个目录(原文强调“缺一个都会报错”):

  • models/MiniMax-H3/(单文件权重)
  • models/diffusers/MiniMax-H3/(分片版本,含 config.json)

五、加载工作流 & 第一次生成(跑通标准化流程)

1)加载工作流

  • GGUF 仓库一般会附带工作流 JSON(例如 MiniMax FL2V GGUF (WORKFLOW).json),下载后拖进 ComfyUI 即可。
  • 官方原生路线:模板浏览器内置 H3 官方工作流,直接选。

2)加载后先检查 4 个节点(变绿再点生成)

  1. Unet Loader (GGUF):选择主模型
  2. CLIP Loader (GGUF):选择 qwen3vl 文本编码器
  3. VAE Loader:视频 VAE / 音频 VAE 两个,别接反
  4. 分辨率与时长:第一次建议 480p、5 秒

3)第一次跑慢是正常的

第一次会把权重从硬盘加载进来。8G–12G 显存机器,5 秒 480p、20 步,心理预期大概 8–15 分钟(原文范围)。

第二次会快很多,因为部分权重已经缓存在内存里。


六、实测体验:怎么把片子拍好看(提示词技巧)

跑通只是入门,真正决定出片质量的是提示词。H3 有个特点:它真的能听懂“镜头语言”。

1)提示词要写“分镜”,不要写“标签”

过去 SD 那套“关键词堆砌”,在 H3 上效果一般。H3 更吃完整场景描述 + 镜头调度。

不好的写法(原文示例):

1
一个女人,咖啡馆,下雨,电影感,8k,高质量

好的写法(原文示例):

1
2
3
4
黄昏的咖啡馆靠窗位置,窗外下着小雨。一位穿米色针织衫的女性
正低头搅拌咖啡,镜头从她的手部特写缓慢上摇至面部,她抬头看
向窗外,嘴角微微上扬。暖色调室内灯光,窗外冷色调环境光形成
对比。背景音:雨声、咖啡杯轻碰声、隐约的爵士乐。

差别在于:第二种把画面、动作、运镜、光线、声音都交代清楚了。H3 的音频是跟画面一起生成的——你不写声音,它就会自己猜,往往不如你预期。

2)镜头运动可以直接用术语

推、拉、摇、移、跟、升降,H3 都认。英文也可以:dolly in / pan left / crane shot / handheld。

3)角色一致性:靠 Ref2VA

Ref2VA 分区可以喂同一个角色的多张参考图(最多 9 张,建议 3–5 张不同角度),再配语音参考,就能做出跨镜头一致的人物与声音。

经验:参考图质量比数量重要。5 张清晰正侧面照,胜过 9 张糊图。

4)15 秒不够:尾帧接首帧

单次最长 15 秒是硬限制。想做长片就用“尾帧接首帧”串起来:第一段最后一帧导出作为第二段首帧输入,再配合 Ref2VA 锁角色。


七、常见问题排查(对着抄就行)

  • 报错找不到节点:ComfyUI 版本太老,或没装 ComfyUI-GGUF
  • 加载模型爆显存:换更低量化;启动参数加 --lowvram
  • 生成没声音:音频 VAE 是否 fp32(必须)
  • 音画不同步:视频/音频 VAE 是否接反
  • 速度慢到离谱:模型是否在固态硬盘;机械盘会让 offload 慢很多;同时确认内存是否足够(不够会走虚拟内存,更慢)
  • 画面崩坏/人物变形:量化太狠(Q2/Q3 画质损伤客观存在);要么加显存,要么降分辨率换质量

总结:这次开源的意义到底在哪?

我更认同原文的判断:意义不在于“又多了一个能跑的模型”,而在于——开源视频模型第一次在可控性上,逼近甚至追平了部分闭源产品。

音画同步生成、跨镜头角色一致、镜头语言可控、11 种语言口型……这些在半年前还是闭源产品的护城河,现在权重就能落在你硬盘里。

门槛当然还在:12G 显存是相对舒服的起点;8G 能跑,但需要耐心和取舍。不过考虑到开源第一周,量化与推理优化迭代通常很快,再过一两个月体验大概率会更友好。


总结

H3 这次开源的意义,我觉得不在于”又多了一个能跑的模型”,而在于开源视频模型第一次在可控性上追平了闭源产品。

  • AD -

音画同步生成、角色跨镜头一致、镜头语言可控、11 种语言口型,这些能力放在半年前还是闭源产品的护城河,现在权重就在你硬盘里。

配置门槛确实还在。12G 显存是目前比较舒服的起点,8G 能跑但需要耐心。但考虑到这才是开源第一周,量化方案和推理优化的迭代速度一向很快,再过一两个月的情况大概率会更好。

想玩的现在就可以动手了。有问题欢迎在评论区交流,我看到都会回。