MiniMax H3 本地部署到 ComfyUI:从零安装到第一条有声视频
面向 Windows 与 NVIDIA 显卡用户,逐项完成环境检查、ComfyUI 更新、H3 模型组件下载、目录放置和首次 5 秒基线验证。
它解决什么问题
先理解你要部署的是什么
MiniMax H3 不是放进 checkpoints 就结束的单文件模型。推理链包含 H3 扩散模型、Qwen3-VL 32B 文本编码器、视频 VAE 与音频 VAE。开放的 H3-Base 负责本地 768p 生成;Context-IR 和 H3-Regenerate-2K 未作为本地权重开放。本教程的验收目标是稳定输出约 5 秒、24 FPS、带 32 kHz 立体声的 768p 视频。
一、硬件与磁盘准备
H3 是 33B 级稠密音视频生成模型,文本编码器也很大。官方没有适用于所有量化版本的统一最低显存,下面是稳妥起点。
- 建议 NVIDIA 24GB 显存、64GB 内存。16GB 可尝试剪枝量化与卸载,但更依赖具体显卡。
- 基线模型约占 43–45GB;连同缓存和输出,建议准备 80GB 以上空闲 SSD。
- 更新 NVIDIA 驱动,关闭游戏、剪辑软件等占显存程序;笔记本切到独显高性能模式。
先在 PowerShell 检查显卡、驱动和剩余空间:
nvidia-smi
Get-PSDrive -PSProvider FileSystem若 nvidia-smi 无法显示显卡,先修复驱动。已有 ComfyUI 用户先备份 workflow、自定义节点列表和启动参数。
二、安装或更新 ComfyUI
H3 节点已经进入 ComfyUI 主线,不需要为了基础 T2VA、I2VA 和 Ref2VA 安装来历不明的自定义节点。最常见的“节点不存在”原因,是 ComfyUI 版本太旧。
新用户可以使用 ComfyUI Desktop 或 Windows Portable。
Git 安装用户可在独立目录执行:git clone https://github.com/Comfy-Org/ComfyUI.git
cd ComfyUI
python -m venv .venv
..venvScriptsActivate.ps1
python -m pip install --upgrade pip
pip install -r requirements.txt已有 Git 安装确认没有未提交修改后再更新。Portable 用户使用自带 update 脚本,不要混用系统 Python。启动后搜索 MiniMaxH3,应能看到 EmptyMiniMaxH3LatentAV、MiniMaxH3ImageToVideo、MiniMaxH3ReferenceToVideo 和 MiniMaxH3SigmaShift;看不到说明更新的不是当前实例。
三、选择第一套可运行权重
初次部署不要同时下载 BF16、INT8、FP8、FL2VA 和 Ref2VA 全家桶。先用 FL2VA 跑通文本、首帧和首尾帧模式。一个偏向节省磁盘和显存的基线组合是:
- minimax_h3_fl2va_pruned_fp8_scaled.safetensors:约 20.96GB,放入 diffusion_models。
- qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors:约 15.69GB,放入 text_encoders。
- minimax_h3_video_vae_fp16.safetensors:约 5.21GB,放入 vae。
- minimax_h3_audio_vae_fp32.safetensors:约 0.61GB,放入 vae。
- minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors:约 1.96GB,可选,放入 loras。
FP8/NVFP4 兼容性取决于显卡与当前 ComfyUI;若报精度或算子错误,改用官方 INT8 ConvRot 或 BF16,不能只改扩展名。
安装 / 开始使用
四、按 ComfyUI 目录放置模型
推荐用 Hugging Face CLI 指定文件下载。先在实际启动 ComfyUI 的 Python 环境安装工具:
pip install -U "huggingface_hub[cli]"
hf auth login在 ComfyUI 根目录执行下面命令。每条命令只下载所需文件,并保留仓库中的子目录结构:
hf download Comfy-Org/MiniMax-H3 diffusion_models/minimax_h3_fl2va_pruned_fp8_scaled.safetensors --local-dir models
hf download Comfy-Org/MiniMax-H3 text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors --local-dir models
hf download Comfy-Org/MiniMax-H3 vae/minimax_h3_video_vae_fp16.safetensors --local-dir models
hf download Comfy-Org/MiniMax-H3 vae/minimax_h3_audio_vae_fp32.safetensors --local-dir models需要 4 步 Turbo 时再下载 LoRA:
hf download Comfy-Org/MiniMax-H3 loras/minimax_h3_fl2v_turbo_4step_v1.0_768p_comfyui_bf16.safetensors --local-dir models下载后检查文件大小,不要放进 checkpoints。若模型在其他磁盘,可用 extra_model_paths.yaml 配置绝对目录,修改后完全重启 ComfyUI。
五、导入官方模板并做最小验证
从 ComfyUI 模板库选择 MiniMax H3 Text to Video。先不加放大、插帧、LoRA 和第三方节点,确认加载器能选到四个模型文件,再写一条容易验收的提示:
清晨的安静厨房,一只橘猫从木桌跳到窗台,镜头缓慢向右平移。窗外有轻微雨声,猫落地时发出柔和的爪垫声,室内没有音乐。第一次使用 768 短边、约 5 秒和 124 帧。排队后观察终端:编码器、扩散模型、视频 VAE、音频 VAE 应依次加载。首次运行通常明显更慢。
六、怎样判定部署真正成功
按以下清单验收:
- 视频可以完整播放,不是零字节或只有黑帧。
- 属性显示约 24 FPS,时长与设置接近。
- 有可播放的立体声音轨;雨声和落地声与画面大致同步。
- 第二次使用相同参数能够再次完成,没有模型缺失或随机崩溃。
- 保存这份最小工作流,并记录 ComfyUI 提交版本、模型文件名、显卡、峰值显存和生成耗时。
加载卡住先核对路径和大小;采样 OOM 先缩短时长、降低画布;有画面无声音则检查 Audio VAE 与合并节点连线。