LoRA MiniMax H3 360 Orbit para ComfyUI: una foto, órbita completa

ComfyUI Wikinews

Un LoRA de la comunidad para MiniMax H3 FL2VA convierte una sola foto en una órbita de cámara de 360 grados que vuelve a su primer fotograma, con los ajustes de ComfyUI.

MiniMax-H3-360-Orbit-LoRA es un adaptador de la comunidad para MiniMax H3 FL2VA que lleva la cámara alrededor de un sujeto mientras la escena permanece congelada en un único instante, y después aterriza en el fotograma exacto desde el que partió. Introduce la misma imagen como primer y último fotograma clave y el clip se reproduce en bucle sobre sí mismo, de modo que las órbitas se pueden encadenar sin una costura visible. Pablo Dawson publicó los pesos el 27 de septiembre junto con las configuraciones, el prompt y la receta de entrenamiento que los respaldan.
Cuatro órbitas de 360 grados generadas a partir de una sola foto cada una con el LoRA MiniMax H3 360 Orbit

Cuatro órbitas independientes, cada una generada a partir de una foto usada como fotograma inicial y final. Fuente: MiniMax-H3-360-Orbit-LoRA.

Qué hace el LoRA

MiniMax H3 tiene dos rutas de vídeo, y el hueco entre ellas es lo que rellena este adaptador. Referencia a vídeo trata sus imágenes de entrada como referencias de apariencia flexibles, así que un clip no termina en un fotograma conocido y dos clips no se pueden unir de forma limpia. La generación de primer y último fotograma fija ambos extremos, lo que hace que las uniones sean exactas, pero de fábrica apenas se mueve cuando el primer y el último fotograma son la misma imagen, porque el modelo interpreta la solicitud como una imagen fija.

El adaptador, en cambio, enseña al modelo una órbita real y geométricamente coherente. La escena se declara congelada, solo viaja la cámara, y como el fotograma final está fijado al fotograma inicial, el movimiento se cierra en un bucle.

Una órbita renderizada a partir de una sola foto, usando la misma imagen como fotograma inicial y final.

Comparación con el modelo base

Cada comparación a continuación renderiza la misma entrada tres veces con una semilla, un prompt, una resolución y un número de pasos idénticos. De izquierda a derecha: modelo base solo con el primer fotograma, modelo base con primer y último fotograma, y el modelo base más este LoRA con primer y último fotograma.

Comparación del modelo base con un fotograma clave, el modelo base con dos fotogramas clave idénticos y el modelo más el LoRA de órbita

Una escena de skate: el modelo base o se aleja de la vista inicial o se congela, mientras que el LoRA completa la órbita y regresa al primer fotograma.

Segunda comparación de las órbitas del modelo base y del LoRA alrededor de una figura de pie

La misma comparación triple alrededor de una figura de pie.

MP4 a resolución completa de la comparación triple anterior.

El LoRA por sí solo, sin los paneles del modelo base al lado.

El prompt

El autor pide que este prompt se use textualmente:

One frozen instant. Only the camera moves. In a continuous 360 orbit. Preserve every person and object in exactly the same world position, orientation, shape and pose throughout the shot. Airborne objects remain suspended at the captured height and angle: no wobbling, shaking, spinning, drifting, falling or continued action. Keep faces, hands, clothing, liquids and the background motionless while retaining their natural appearance. Camera parallax is the only source of apparent movement. No cuts, zoom, morphing or added objects.

Configuraciones recomendadas

configuraciónvalor
pesos baseMiniMax H3 FL2VA pruned, el repack INT8 ConvRot de Comfy-Org/MiniMax-H3
fotogramas clavela misma imagen como primer y último fotograma, para un bucle completo de 360 grados
resolución768 × 768
fotogramas73 (unos 3 s a 24 fps)
pasos28
orientaciónninguna. MiniMax H3 está destilado con orientación, así que no hay CFG ni prompt negativo
fuerza del LoRA1.0
audiodesactivado

Cómo ejecutarlo en ComfyUI

El adaptador es un único LoRA solo de modelo con nomenclatura de ComfyUI (claves diffusion_model.*), por lo que no se requieren Nodos Personalizados:

  1. Descargar minimax_h3_flf2v_lora_v1.safetensors en ComfyUI/models/loras/.
  2. Abrir un flujo de trabajo de primer y último fotograma de MiniMax H3 y apuntarlo a la base FL2VA INT8 pruned con su text encoder y los VAE de vídeo y audio de H3.
  3. Aplicar el LoRA con fuerza 1.0 mediante un cargador de LoRA solo de modelo.
  4. Cargar una imagen en ambas ranuras de fotograma clave y pegar el prompt anterior sin cambios.

La tarjeta indica que el LoRA se entrenó y probó con ostris/ai-toolkit y su extensión minimax_h3, y que el adaptador de entrenamiento usado durante el entrenamiento no es necesario en el momento de la inferencia.

Cómo se entrenó

El conjunto de datos es deliberadamente monotemático. Cada clip muestra el movimiento que el LoRA debe aprender y nada más, así que el modelo nunca ve moverse a un sujeto:

  • 28 renders de órbita alrededor de Gaussian splats humanos elegidos a mano. Como los splats son escenas 3D estáticas, cada fotograma es geométricamente coherente por construcción, y la cámara es lo único que cambia entre fotogramas.
  • Formato del clip: 768 × 768, 73 fotogramas, 24 fps, un caption para todos los clips (el prompt anterior), caption dropout 0.05, sin audio.
  • Adaptador: rank 16, alfa 16, aplicado a todas las capas lineales del transformer excepto adaln_proj, 208 módulos en total.
  • Entrenamiento: 3000 pasos (unas 107 épocas), tamaño de lote 1, AdamW de 8 bits con lr 1e-4, bf16 con gradient checkpointing, timesteps desplazados de flow-matching, pérdida MSE. Una NVIDIA A100 de 80 GB tardó 10 h 24 min, aproximadamente 12,5 s por paso.

Limitaciones

El autor es explícito sobre lo limitado de este lanzamiento:

  • El dominio es limitado. El entrenamiento usó 28 clips cuadrados centrados en personas de 73 fotogramas. Otros sujetos, otras relaciones de aspecto y otras duraciones de clip no se han probado.
  • Los movimientos pequeños pueden sobrevivir. Puede seguir apareciendo algo de movimiento sutil, en particular parpadeos, aunque se supone que la escena está congelada.

Disponibilidad

Descargar minimax_h3_flf2v_lora_v1.safetensors (148 MB)

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
LoRA MiniMax H3 360 Orbit para ComfyUI: una foto, órbita completa | ComfyUI Wiki