MiniMax H3 变换 LoRA:在两张图像之间实现形态转换
ComfyUI Wikinews
一款 MiniMax H3 LoRA,可将一张图片变形为另一张:元素、材质与主体在 ComfyUI 中沿无缝的首尾帧过渡互相转化。
Tr@nsf0rmation_style(Hugging Face)是一款面向 MiniMax H3 的社区 LoRA,可将一张图片变形为另一张。给定起始帧和目标帧,它会逐元素地拆解第一个场景,再把这些碎片重组为第二个场景,于是主体互相溶解、材质在移动过程中发生变化、轮廓也在途中重新绘制。Ashmotv 于 9 月 25 日发布了权重,包含两个模型、十段示例片段,以及该适配器所需的提示词格式。
来自某段展示片段的一帧,其中第一张图片里的每个主体都被指派了第二张图片中的对应对象。
功能说明
MiniMax H3 的首尾帧路径通常把两张图像读作同一个连续镜头的两端:相机或主体发生移动,而场景保持可辨识的一致。这个适配器则把两帧变成起始状态与结束状态。两者之间的一切都是过渡过程,模型经过训练,会把各个视觉元素分别带过这段过渡,而不是对整幅图像做交叉淡入淡出。
由于对应关系会在提示词中明确写出,一次生成就能同时承载多种变换。在下面的示例中,穿灰色 T 恤的人变成第二张图片里的女孩,穿黄色衬衫的人变成黄色的草地,穿绿色衬衫的人变成空白背景,全部发生在同一段视频中。
提示词格式
该适配器使用一个触发词加一个动作连接词,当提示词明确指出每个主体、材质或元素如何转变成其对应对象时,效果最佳:
- 触发词:
Tr@nsf0rmation_style - 动作连接词:
Tr@nsf0rmation into
推荐的模板为:
integrated_multimodal_description: [Shot 1] Tr@nsf0rmation_style, Picture 1 Tr@nsf0rmation into Picture 2 with individual elements and subjects Tr@nsf0rmation into one another.以下是一个更具体的示例,来自模型卡片:
integrated_multimodal_description: [Shot 1] Tr@nsf0rmation_style, Picture 1 Tr@nsf0rmation into Picture 2 with individual elements and subjects Tr@nsf0rmation into one another. The bald person in grey T-shirt and blue jeans from <Picture 1> Tr@nsf0rmation into the Girl in <Picture 2>. The person in the Yellow shirt from <Picture 1> Tr@nsf0rmation into the yellow grass from <Picture 2>. The person in the green shirt from <Picture 1> Tr@nsf0rmation into the blank background in <Picture 2>.示例
多元素场景重组:第一张图片中的每个人都被变换为第二张图片中不同的元素。
两个场景之间直接的视觉变换。
铅笔笔触的演变,使用的是更具体的提示词变体,其中各个铅笔笔触会互相转化。
另外七段片段涵盖流体过渡、语义变形、复杂主体替换和高保真流动,可在模型卡片上查看。
推荐设置
| 设置 | 值 |
|---|---|
| 基础权重 | MiniMax H3 FL2VA 或 Ref2V,例如来自 Comfy-Org/MiniMax-H3 的 minimax_h3_fl2va_pruned_int8_convrot.safetensors |
| 模型 | Transformation_style_c1-st2500 是已完全收敛的版本,-st1600 更柔和、更轻量 |
| LoRA 强度(st2500) | 1.0 到 1.2 |
| LoRA 强度(st1600) | 1.0 到 1.4 |
| 叠加设置 | st2500 设为 1.2 再加 st1600 设为 1.4,展示片段即采用此配置 |
| 采样器 / 调度器 | res_multistep 或 euler 搭配 simple;ResMultistep 的过渡最稳定 |
| 步数 | 使用 DMD turbo 适配器时为 12 步,标准情况下为 25 到 30 步 |
| sigma shift | shift_video 8.0 与 shift_audio 3.0 |
| 分辨率 | 852 × 480 或 1024 × 576,可放大到 1080p |
在 ComfyUI 中运行
文件以 ComfyUI 的命名方式分发(Transformation_style_*_comfyui.safetensors),因此不需要自定义节点:
- 将你需要的模型文件下载到
ComfyUI/models/loras/中。 - 在 MiniMax H3 UNet 加载器之后添加一个 LoraLoaderModelOnly 节点,并把
strength_model设为 1.0 到 1.2 之间。 - 将起始图片和目标图片接入首尾帧条件节点。
- 按上文所示,使用
Tr@nsf0rmation_style触发词和Tr@nsf0rmation into连接词来编写提示词。
获取方式
- LoRA 权重:Ashmotv/transformation_lora
- 基础模型重打包版:Comfy-Org/MiniMax-H3
下载 Transformation_style_c1-st2500_comfyui.safetensors(36 MB)
评论
使用 GitHub 登录后即可参与讨论。