LoRA de nitidez para MiniMax H3: recuperación de detalles en vídeo

ComfyUI Wikinews

El LoRA de nitidez H3 de Alissonerdx recupera detalle en un pase v2v a la misma resolución: latentes guía, un archivo de 1,2 GB y flujo de trabajo ComfyUI incluido.

Un nuevo LoRA de nitidez para MiniMax H3 adopta una ruta diferente para mejorar el detalle en vídeo: en lugar de ampliar, ejecuta un pase v2v a la misma resolución que devuelve detalle nítido y fotorrealista a las salidas de H3 suaves o demasiado alisadas. El LoRA, minimax_h3_lms_v1.0_r64, fue entrenado y publicado por el entrenador de la comunidad Alissonerdx en Hugging Face, donde ha acumulado más de 70 me gusta y 1.300 descargas en sus primeros días, y se ha convertido en una de las herramientas más comentadas de la comunidad H3.

ANTES: salida estándar de H3DESPUÉS: pase con LoRA de nitidez
AntesDespués
ANTES: salida estándar de H3DESPUÉS: pase con LoRA de nitidez
AntesDespués

Cómo funciona: latentes guía, no vídeo de referencia

El LoRA de rango 64 se acondiciona sobre el vídeo fuente mediante latentes guía en lugar del nodo nativo de vídeo de referencia del modelo. El clip fuente se codifica con el VAE y se empaqueta en la secuencia del transformer como un bloque de acondicionamiento alineado con la línea temporal objetivo: mismo origen temporal, misma cuadrícula espacial, y no avanza el reloj de referencia. Se trata de la misma disposición en contexto que usan los LoRA de vídeo en LTX, y entrega la correspondencia a nivel de píxel directamente al modelo en lugar de obligarlo a buscarla.

Consecuencias prácticas:

  • La guía se entrena casi limpia (aproximadamente un 0,1 % de aumento de ruido), mientras que al objetivo se le aplica ruido con normalidad, de modo que el modelo aprende una correspondencia fuente-objetivo en lugar de eliminar el ruido de ambos
  • El codificador de texto nunca ve la guía, solo el caption
  • La guía y el objetivo deben tener longitudes de clip válidas (17k + 5 fotogramas: 5, 22, 39, 56...) a la misma resolución
  • Una guía más corta o de tamaño distinto rompe la alineación

En ComfyUI esto utiliza el nodo nativo MiniMaxH3AddGuide (frame_idx = 0) que viene con el soporte H3 propio de ComfyUI, por lo que no hay nada extra que instalar para la ruta de acondicionamiento. El LoRA se entrenó específicamente para la variante ref2va y está pensado principalmente como un segundo pase sobre clips ya generados, aunque también puede usarse para generación directa.

Resultados de la comunidad

El LoRA circuló en el Discord de Banodoco antes y después de su lanzamiento, donde los probadores coincidieron en algunas notas de uso:

  • No es un ampliador: el aumento de nitidez funciona a la misma resolución que la fuente, así que combínalo con un flujo de trabajo de ampliación si necesitas más píxeles
  • Una fuerza en torno a 0,8 mantiene la piel y las texturas naturales; llevarla a 1,0 en ambos pases resulta extremo
  • Requiere el nodo Add Guide para funcionar, ya que el entrenamiento se basó en latentes guía
  • También funciona en H3 como pase de detalle con acondicionamiento al estilo LTX, según las pruebas cruzadas entre modelos de otros entrenadores

Un segundo LoRA de nitidez experimental del entrenador NRDX siguió una construcción similar y mostró un aumento de nitidez extremo comparable con fuerza 1, lo que confirma que el enfoque de latentes guía funciona para esta clase de tareas.

El flujo de trabajo oficial integra AIToolkitMiniMaxH3RefVideo de ostris/ComfyUI-AIToolkit-MiniMaxH3 para la entrada de la guía. Si prefieres no añadir ese nodo personalizado, cualquier paso de redimensionado que alimente a Add Guide funciona, ya que el nodo de ostris solo redimensiona el clip antes de la codificación de la guía.

Disponibilidad

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
LoRA de nitidez para MiniMax H3: recuperación de detalles en vídeo | ComfyUI Wiki