返回目录
学习指南AI 视频制作进阶

MiniMax H3 ComfyUI 原生工作流:T2VA、I2VA 与首尾帧完整实战

从原生节点连线、合法帧数和画布规则开始,完成文生有声视频、首帧续写与首尾帧可控转场,并建立可复用提示词模板。

1 次阅读2026/08/22 发布
MiniMax H3 ComfyUI 原生工作流:T2VA、I2VA 与首尾帧完整实战 来源图片

它解决什么问题

三种模式先选对,再谈参数

MiniMax H3 的 FL2VA 基础权重同时覆盖三种常用任务:不输入图片就是 T2VA;只接 first_frame 是 I2VA;同时接 first_frame 与 last_frame 就是 FL2VA。三者共享文本编码、采样、视频 VAE、音频 VAE和保存链路,区别发生在 MiniMaxH3ImageToVideo 节点的图像条件输入。初学者最容易犯的错误,是使用 I2VA 工作流却在提示词里重新描述人物外观,导致模型一边遵循首图、一边尝试重画人物。

T2VA、I2VA 与 FL2VA 的输入区别
T2VA、I2VA 与 FL2VA 的输入区别

一、认识原生节点链

官方模板通常把一部分节点折叠成子图,但逻辑可以拆成六段:加载扩散模型;加载 Qwen3-VL 文本编码器;加载视频和音频 VAE;用 MiniMaxH3ImageToVideo 生成条件与音视频空潜变量;通过 MiniMaxH3SigmaShift、调度器和采样器完成去噪;分别解码视频与音频并合并保存。

基础排错时不要大幅改线。先从官方模板复制一份,命名为 H3-baseline-v1。每次只改画布、时长、种子或输入图片中的一项,成功后另存版本。这样出现黑帧、无声或 OOM 时,可以快速回到已验证状态。

二、画布与帧数的硬规则

H3 原生节点会把宽高对齐到 32 的倍数,默认以 768 像素短边工作,并把画布像素控制在约 768×1344 的上限内。不是分辨率越大越好:空间 token 与时间 token 同时增长,显存和耗时会急剧增加。竖屏可从 768×1344 起步,横屏可从 1344×768 起步,方形则使用 768×768。

MiniMax H3 的帧数与画布对齐规则
MiniMax H3 的帧数与画布对齐规则

输出为 24 FPS,长度需要满足 length 对 17 取余等于 5。124 帧约为 5 秒,也是非常适合排错的基线。官方节点常见训练长度范围约 124 到 362 帧。若模板带秒数换算表达式,只修改 duration,让表达式自动吸附到合法帧数;不要同时手工改 duration 和 length,否则界面显示的秒数可能与实际不一致。

三、T2VA:先做一个只有一个主动作的镜头

T2VA 不连接首帧和尾帧。提示词建议按照“镜头与时间—主体与动作—环境变化—声音—不要出现什么”的顺序书写。H3 会联合生成音视频,因此对白、环境音和音乐都应直接写进同一提示,而不是等出片后才发现模型自动加了不需要的配乐。

一个便于验证的结构是:

text
[0–2秒] 中景,镜头缓慢推进。咖啡师把白色杯子放到木桌中央。
[2–5秒] 她用银色小壶倒入牛奶,杯面形成简单心形拉花,动作连续自然。
声音:安静咖啡馆环境声、轻微瓷杯碰桌声和倒奶声;无对白、无背景音乐。
约束:杯子数量始终为一个,手指结构自然,镜头不切换。

先用固定种子连续测试。若主体动作正确但声音不对,只改声音段;若构图不稳定,只改镜头和主体位置。不要一次加入多个角色、快速转场、长对白、爆炸和复杂运镜,因为失败后无法判断是哪一部分造成问题。

安装 / 开始使用

四、I2VA:让首帧负责外观,让文本负责运动

把图片连接到 first_frame 前,先裁成目标画布比例。人物脸部、产品文字和构图越接近最终画面,模型需要“纠正”的内容越少。提示词不必重复“一个穿红衣、黑色短发的人”这类首图已经明确的信息,而应描述她接下来做什么、相机怎么动、背景发生什么变化以及应该听到什么。

操作顺序如下:

  1. 在 Load Image 导入首图,检查没有透明通道异常和错误旋转。
  1. 用裁剪或缩放节点得到 32 倍数的目标尺寸,不要强行拉伸人物。
  1. 将图像接到 MiniMaxH3ImageToVideo 的 first_frame,last_frame 保持空。
  1. 先用 124 帧和低复杂度运动测试,确认人物没有在第一帧突然变脸。
  1. 提示词重点写“从当前姿势继续”,避免要求画面瞬间变成完全不同的季节、服装和场景。

示例:

text
从输入画面自然延续。人物先看向窗外,随后轻轻转头面对镜头并微笑;镜头保持肩部近景,只做非常缓慢的前推。窗帘被微风轻轻吹动,皮肤纹理和发型保持一致。声音只有室内轻微风声与布料摩擦声,无对白、无音乐。

五、FL2VA:首尾状态必须可以被合理连接

首尾帧模式不是任意两张图片之间的魔法传送。两张图的主体身份、画幅、镜头高度和整体构图越接近,过渡越稳定。比如首帧是正面近景、尾帧是同一人物微微侧身,模型能设计自然转身;首帧在室内近景、尾帧变成外太空大全景,则很容易出现快速溶解、身份丢失或中间帧崩坏。

将第二张图连接 last_frame,并在提示词中解释状态变化的路径,而不是只重复两张图:

text
从首帧开始,舞者沿顺时针方向缓慢转身,右手抬起带动薄纱形成连续弧线;镜头小幅环绕并保持人物居中。最后一秒动作自然减速,身体姿态与尾帧完全衔接。声音是脚步与薄纱摩擦声,远处有低音量鼓点,不出现对白。

如果最后半秒突然跳变,优先检查两张图的比例、人物尺度和光向,再增加描述中间动作的细节;不要先把采样步数拉到很高。

六、采样、Sigma Shift 与 Turbo 的使用顺序

原生 MiniMaxH3SigmaShift 通常为视频和音频分别设置偏移,常见默认值是 video 12、audio 3。初次使用保留官方模板值。改变 shift 会影响不同噪声区间的采样分配,不适合用作“清晰度滑块”。

原始 CFG-distilled 权重应使用官方模板给出的采样配置。Turbo LoRA 必须配套相应的 4 步或 8 步工作流与步数;只加载 LoRA 却继续使用原流程,或加载 4 步 LoRA 却设置大量步数,都可能让细节、皮肤和运动变差。正确顺序是:先用无 LoRA 基线验证模型;保存结果和耗时;复制工作流后再加载 Turbo;保持相同提示、种子、尺寸和时长做 A/B 对比。

七、输出前的质量检查

  • 第一帧是否与输入图一致,是否在开头瞬间重绘。
  • 人物数量、服装和道具是否在整个镜头内保持一致。
  • 相机运动是否与主体动作冲突,例如镜头推进时主体又快速冲向镜头。
  • 尾帧模式是否在最后一秒自然减速,而不是突然硬切。
  • 音轨是否存在、左右声道是否正常、事件音是否大致同步。
  • 文件名是否包含模式、种子、尺寸、帧数和版本,方便复现。

完成后把最佳基线复制为三个模板:H3-T2VA、H3-I2VA、H3-FL2VA。以后只替换提示和输入图,减少误触模型加载、VAE 和保存节点的机会。

适用场景

文生有声视频
首帧图生视频
首尾帧转场
提示词与参数复用