返回目录
开源项目AI 音频与语音类新手

MiniMax H3 Audio T8 - ComfyUI 原生 H3 音频节点扩展

面向 ComfyUI 原生 MiniMax H3 的扩展节点包,当前 1.12.0 注册 54 个节点,覆盖音画条件、对白分析、长视频续写、语音链、来源视频音画重绘等实验与稳定功能。代码采用 GPL-3.0-or-later,不包含模型权重,需配合 ComfyUI 及 MiniMax H3 模型使用。

0 次阅读2026/08/10 发布
MiniMax H3 Audio T8 - ComfyUI 原生 H3 音频节点扩展 来源图片

社区作者 · Aitroys 管理员

它解决什么问题

MiniMax H3 Audio T8 是一个面向当前 ComfyUI 原生 MiniMax H3 的独立节点扩展。当前版本为 1.12.0,共注册 54 个节点,按稳定性与用途分为七个菜单:稳定菜单 T8/MiniMax H3/Audio(音画条件、音频处理、预检、双时钟采样与 AV 解码),以及若干 Experimental 菜单(多速率采样、Ref2VA 静态图像编辑、视觉参考强度、长视频续写、语音链、来源视频音画重绘)。

本包不是把源音频简单塞进 latent,而是按 ComfyUI 当前 H3 实现维护媒体展示顺序、<Picture N> / <Video N> / <Audio N> 标签、联合 AV latent、首尾关键帧、参考媒体和噪声掩码之间的契约。基础节点没有额外 pip 依赖,复用 ComfyUI 自带的 PyTorch、torchaudio 和 MiniMax H3 实现;可选语音校验才延迟导入 faster-whisper 或 transformers,缺少它们不会阻止插件加载,也不会暗中下载模型。

当前真实生成验证基线为 ComfyUI 0.31.0 提交 cbbc9dab1,运行环境 Python 3.10+。模型、VAE、CLIP 和可选 LoRA 需按具体任务自行安装。项目目录包含 tools/(MiniMax H3 Turbo LoRA 转换工具)、docs/(使用说明与验证记录)、examples/(API 与 ComfyUI 前端工作流)和 artifacts/(历史发布包和代码迁移归档)。1.12.

0 保留此前 51 个节点的 ID、顺序、默认值和旧接线,只在末尾追加 3 个完全隔离的 Dialogue Safe Audio EXP 节点;旧工作流不会自动运行 ASR、改变联合 latent、分离混合音轨或替换最终音频。早期版本均保持旧节点兼容。实验功能包括:对白边界分析、对白安全分轨混音、分时背景底轨锁定、来源视频音画重绘、视觉参考强度、分段长视频续写、原生语音与参考音色等。项目代码采用 GPL-3.0-or-later,不含模型权重;MiniMax H3 权重许可独立于本仓库 GPL 代码。

适用对象为使用 ComfyUI 进行音视频生成、需要高级音频控制、长视频续写或语音合成研究的用户。

— 本文由 AI 根据公开来源辅助整理,命令、版本与许可证请在使用前到原始页面复核。

安装 / 开始使用

步骤 1 · 准备环境:已安装 ComfyUI(验证基线为 0.31.0,提交 cbbc9dab1),

可复制命令
Python 3.10+

,并已安装 MiniMax H3 所需的模型、VAE、CLIP 及可选 LoRA。基础节点无额外 pip 依赖,复用 ComfyUI 自带的 PyTorch、torchaudio 和 MiniMax H3 实现。可选语音校验功能需要 faster-whisper 或 transformers,缺少它们不会阻止插件加载。ASR 模型可放在 ComfyUI/models/TTS/<folder> 或使用绝对目录;说话人模型同样支持 models/TTS/<folder>。

  1. 安装:将项目目录放入 ComfyUI 的 custom_nodes/minimax-h3-audio-T8。
  1. 重启 ComfyUI。重启后可在菜单 T8/MiniMax H3/Audio 及 T8/MiniMax H3/Experimental 等菜单中找到节点。
  1. 首次运行:导入 examples/ 下的工作流,替换占位参考图或音频,检查模型、VAE、CLIP、LoRA 与输出目录是否符合本机环境。
  1. 常见问题:升级节点后画布看不到新节点时,需完整重启 ComfyUI,仅刷新浏览器不会重新加载 Python 节点 schema。旧工作流不会自动启用实验功能;只有主动插入实验节点才会使用新增字段。若需使用语音校验,请自行安装 faster-whisper 并提供本地 CTranslate2 模型;插件不自动下载模型也不分发权重。长时间生成建议合理选择释放策略(keep_loaded / clear_execution_cache / unload_all_models)。

适用场景

音画条件生成:T2VA
I2VA
FL2VA
L2VA
Ref2VA 和 Hybrid 统一条件节点
音频后处理:源音轨与生成音轨混合
输出裁切
音频窗口
提示词标签规范化
长视频续写:分段规划
断点续作
候选预览/接受