H3 Motion Context MultiRef 更新 6:音乐视频与 AV 工作流

ComfyUI Wikinews

ComfyUI H3 Motion Context MultiRef 更新 6 重建了长篇 MiniMax H3 工作流:包括一条 20 插槽的音乐视频链和一条 AV 扩展链,并支持无缝音频与直接流式传输。

H3 Motion Context MultiRef 于 8 月 17 日发布了 更新 6。作为 ComfyUI-H3-Motion-Context 的分支,它以无 checkpoint 的直接 Latent 链形式重建了两个长篇工作流(音乐视频AV 扩展),将最终结果直接流式传输到 VideoHelperSuite,无需再像旧版长篇 H3 工作流图那样为整部影片分配大量 RAM。

随附的音乐视频演示:基于两张参考图像,围绕一首主歌曲生成六个视频片段。

更新 6 中的变化

  • 无 checkpoint 的直接 Latent 链。 两个长篇工作流现在都将每个采样器的视频 Latent 尾部直接传入下一个遮罩上下文节点。更新 5 的磁盘 checkpoint 节点不再注册。
  • 直接流式输出。 新的最终输出节点一次解码一个片段,并将已完成的帧流式传输到 VideoHelperSuite,而不是物化一个完整的最终 IMAGE 张量。已知的高 RAM 路径不再暴露。
  • 精确的 AV 时间对齐。 最终音频拼接使用时间轴的绝对采样边界,避免在 44.1 kHz 等采样率下出现单采样接缝漂移。H3 音频网格的小幅欠冲会进行时间校准,而不是用静音尾部填充。
  • 由控制器控制的绕过。 为生成和预览分组提供真正的 ComfyUI 绕过模式,因此当前两个工作流都不需要 rgthree 进行分组控制。
  • 向前兼容性。 可识别 ComfyUI-PR-#15375 之前和之后的 H3 遮罩集成布局,一旦检测到当前布局,本地回退便会自动停用。

音乐视频

20 插槽的 音乐视频 工作流围绕一首歌曲构建一个多片段视频。起始片段使用 MiniMaxH3ReferenceToVideo 生成,然后每个片段将其视频 Latent 尾部直接传递给下一个片段。主歌曲始终保持权威性:每个片段都在其 H3 音频 Latent 中以音频遮罩 0 接收精确的绝对主歌曲切片,最终输出使用未经改动的原始主波形。

AV 扩展

AV 扩展 工作流可跨多次 H3 生成延续一段视频。一个控制器驱动共享实时链,用于现有视频、T2V 和 I2V/自定义关键帧起始;两个图像参考插槽和两个可选音频参考为起始片段和全部扩展提供输入。受保护的上下文对齐到共享的 H3 视频/音频边界(39 / 90 / 141 / 192…),音频保持一个硬性保留区域,外加可配置的半余弦羽化(默认为 8 个音频 Latent 刻度,0.2 秒),结果会流式传输到 VideoHelperSuite,而无需分配完整的最终影片张量。

示例参考

音乐视频演示随附两张参考图像和一首歌曲,位于 example_workflows/assets/ 中。

参考图像 1参考图像 2
参考图像 1参考图像 2

可用性

通过克隆到 ComfyUI/custom_nodes/ 并重新启动来安装:

cd ComfyUI/custom_nodes
git clone https://github.com/seitanism/ComfyUI-H3-Motion-Context-MultiRef.git

部分随附工作流需要 VideoHelperSuite、KJNodes 和 rgthree;请安装缺失的节点包并重新启动。运行前,请将示例音乐视频资产(两张图像和一首歌曲)放入 ComfyUI 的 input/ 文件夹。请注意,更新 5 的 checkpoint 节点不再注册;使用这些节点保存的工作流必须迁移到当前的直接 Latent 版本。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
H3 Motion Context MultiRef 更新 6:音乐视频与 AV 工作流 | ComfyUI Wiki