ComfyUI 的 MiniMax H3 360 Orbit LoRA:一张照片实现完整环绕
MiniMax H3 FL2VA 的社区 LoRA 能把一张照片变成完整的 360 度相机环绕,并精准回到自身的首帧,附最佳 ComfyUI 设置。
四段各自独立的环绕,每段都以一张照片作为起始和结束关键帧生成。来源:MiniMax-H3-360-Orbit-LoRA。
这个 LoRA 能做什么
MiniMax H3 有两条视频路径,本适配器正是用来填补二者之间的空隙。参考生视频把输入图像当作宽松的外观引用,因此片段不会结束于某个已知帧,两段片段也无法干净地拼接。首尾帧生成会顶固两端,使衔接点精确无误;但在开箱状态下,当首帧与结束帧是同一张图时它几乎不产生运动,因为模型把该请求理解为一张静止画面。
该适配器则教会模型生成真正且几何一致的环绕。场景被声明为冻结,只有相机在移动;由于结束帧被顶固在起始帧上,运动便闭合成环。
由单张照片渲染出的环绕,同一张图像同时用作起始和结束关键帧。
与基础模型的对比
以下每组对比都用相同的种子、提示词、分辨率和步数,把同一输入渲染三次。从左到右依次为:仅使用起始帧的基础模型、使用起始帧和结束帧的基础模型,以及使用首尾帧并叠加本 LoRA 的模型。
一个滑板场景:基础模型要么偏离开场视角,要么完全冻结,而 LoRA 完成了环绕并回到第一帧。
围绕站立人物的同一组三方对比。
上方三方对比的全分辨率 MP4。
仅保留 LoRA 的版本,旁边不再有基础模型的对比画面。
提示词
作者要求原样使用以下提示词:
One frozen instant. Only the camera moves. In a continuous 360 orbit. Preserve every person and object in exactly the same world position, orientation, shape and pose throughout the shot. Airborne objects remain suspended at the captured height and angle: no wobbling, shaking, spinning, drifting, falling or continued action. Keep faces, hands, clothing, liquids and the background motionless while retaining their natural appearance. Camera parallax is the only source of apparent movement. No cuts, zoom, morphing or added objects.推荐设置
| 设置 | 值 |
|---|---|
| 基础权重 | MiniMax H3 FL2VA 剪枝版,即来自 Comfy-Org/MiniMax-H3 的 INT8 ConvRot 重新打包版本 |
| 关键帧 | 同一张图像同时作为起始帧和结束帧,以实现完整的 360 度循环 |
| 分辨率 | 768 × 768 |
| 帧数 | 73(24 fps 下约 3 秒) |
| 步数 | 28 |
| 引导 | 无。MiniMax H3 是引导蒸馏模型,因此没有 CFG,也没有负面提示词 |
| LoRA 强度 | 1.0 |
| 音频 | 关闭 |
在 ComfyUI 中运行
该适配器是单个仅作用于模型的 LoRA,采用 ComfyUI 命名(diffusion_model.* 键),因此不需要自定义节点:
- 将
minimax_h3_flf2v_lora_v1.safetensors下载到ComfyUI/models/loras/。 - 打开一个 MiniMax H3 首尾帧工作流,并将其指向剪枝的 INT8 FL2VA 基础模型,连同其文本编码器以及 H3 视频、音频 VAE。
- 通过仅作用于模型的 LoRA 加载器,以强度 1.0 应用该 LoRA。
- 将同一张图像加载到两个关键帧槽位,并原样粘贴上面的提示词。
模型卡指出,该 LoRA 使用 ostris/ai-toolkit 及其 minimax_h3 扩展进行训练和测试,并且训练时使用的训练适配器在推理阶段并不需要。
训练方式
数据集刻意保持单一主题。每个片段只展示 LoRA 应学习的运动,别无其他,因此模型从不会看到主体发生移动:
- 围绕手工挑选的人物 Gaussian splat 渲染的 28 段环绕。 由于 splat 是静态 3D 场景,每一帧在构造上就是几何一致的,帧与帧之间唯一变化的只有相机。
- 片段格式:768 × 768、73 帧、24 fps,所有片段共用一个描述文本(即上面的提示词),caption dropout 0.05,无音频。
- 适配器:rank 16,alpha 16,应用于除
adaln_proj之外的所有 transformer 线性层,共 208 个模块。 - 训练:3,000 步(约 107 个 epoch),批处理大小为 1,AdamW 8-bit,lr 1e-4,bf16 配合梯度检查点,flow-matching 偏移时间步,MSE 损失。单张 NVIDIA A100 80 GB 耗时 10 小时 24 分钟,每步约 12.5 秒。
局限
作者明确说明了这一发布的适用范围有多窄:
- 领域很窄。 训练使用了 28 段以人物为中心的方形 73 帧片段。其他主体、其他宽高比和其他片段长度均未测试。
- 细微运动可能残留。 尽管场景本应冻结,一些轻微的运动仍可能出现,尤其是眨眼。
获取方式
- LoRA 权重:pablodawson/MiniMax-H3-360-Orbit-LoRA
- 基础模型重新打包版本:Comfy-Org/MiniMax-H3
- 训练工具:ostris/ai-toolkit
评论
使用 GitHub 登录后即可参与讨论。