MiniMax H3 FaceSwap LoRA:替换任意参考视频中的人物

ComfyUI Wikinews

UntMods 为 MiniMax H3 Ref2VA 打造的 FaceSwap LoRA,可用参考图像中的人脸替换参考视频里的人物身份,并附带可直接使用的 ComfyUI 工作流。

FaceSwap_MiniMaxH3_REF2VA 是面向 MiniMax H3 Ref2VA 的 LoRA,可用参考图像中的人脸替换参考视频里的人物身份。该模型由 CRT-Nodes 节点包背后的训练者于 9 月 15 日发布,随附可用的 ComfyUI 工作流、一个触发词和单个 63 MB 的权重文件。
控制图像与替换后的输出帧

左:提供新身份的控制图像。右:使用它生成输出视频中的一帧。

LoRA 改变了什么

在 MiniMax H3 上做人脸替换,通常意味着要强行让整套参考图像脱离其训练时的行为:ref2va 变体本身已接受参考图像,但它用这些图像来引导外观、服装和场景,而不是覆盖片中的演员。这个适配器把任务收窄到人脸。你输入想要保留的视频片段,以及一张或多张新身份的参考图像,再用一个触发词 Faceswap 告诉采样器何时执行替换。

模型卡片中的实用信息:

  • ref2va 训练。 它作用在参考生视频与音频的 H3 权重之上,而非 fl2va 分支。
  • 一个触发词 Faceswap,强度 1.0
  • 剪枝适配器。 低于作者阈值的模块会从 safetensors 文件中移除,这让下载体积保持在 63 MB,用作者的话说就是“更少的 LoRA 伪影,强度与训练基座一致”。
  • 支持多张参考。 随附的工作流包含三个参考图像加载器,并注明该节点“支持单张或多张参考图像”。
控制图像、参考视频与替换后的输出

已发布的演示片段都是三分屏对比,标签直接烧录在画面中:左侧为控制图像,中间为参考视频,右侧为替换后的输出。

在 ComfyUI 中运行

仓库提供 SS_FaceSwap_MiniMax REF2V.json,这是一个前端格式的工作流,基于作者自己的 CRT-Nodes 节点包,外加 ComfyUI-VideoHelperSuite 用于视频的加载与封装:

  1. 安装 CRT-Nodes(在 ComfyUI Manager 中显示为 CRT-Nodes)和 ComfyUI-VideoHelperSuite,然后重新启动 ComfyUI。
  2. 模型仓库下载 SS_FaceSwap_MiniMax_H3_REF2VA.safetensors,放入 ComfyUI/models/loras/MiniMaxH3/SS_FaceSwap/,这正是工作流预期的路径。
  3. 打开工作流,在 VHS 视频加载器中载入来源视频,把新身份图像放入参考图像加载器,并在提示词中写入 Faceswap

示例工作流通过 LoraLoaderModelOnly 以强度 1.0 接入该 LoRA,旁边第二个槽位放着一个 8 步的 Ref2VA turbo LoRA,因此演示片段能以加速的步数渲染。它的采样器是 CRT 的 MiniMaxH3UnifiedSampler,使用 R2V 模式和该节点包的“Balanced (recommended)”预设;与模型一同发布的对比视频标注为 0.7 strength。checkpoint、文本编码器和 VAE 槽位分别指向剪枝 int8 convrot ref2va 基座、nvfp4 Qwen3-VL 32B 文本编码器,以及 H3 独立的 int8 视频 VAE 和 fp32 音频 VAE。

触发词只是条件的一半:该适配器训练的目的就是从参考图像中获取身份,所以视频片段本身的主体保留动作、时间、构图和音频,只有人脸被替换。

模型卡片中的示例

被迁移的身份不一定非得是人。在第二个公布的对比示例中,一只黑猫提供了人脸,结果落在来源视频中的主持人身上:

把猫的身份替换到演播室主持人身上

左侧为控制图像,中间为参考视频,右侧为输出。

控制图像、参考视频以及 0.7 强度下的输出,音频保留自来源视频。

同一套流程用于把猫的身份迁移到演播室主持人身上。

可用性

该链接于 9 月 19 日在 Banodoco 的 #minimax_h3_chatter 中分享,模型卡片在最初几天里已收获超过 55 个赞。公布的演示均为训练者自己的片段;截至撰写时还没有第三方测试结果出现。

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax H3 FaceSwap LoRA:替换任意参考视频中的人物 | ComfyUI Wiki