SelfLift trae el muestreo de resolución progresiva a ComfyUI

ComfyUI Wikinews

comfyui-SelfLift hace el denoising inicial a baja resolución y termina a resolución completa: aceleración sin entrenamiento para Z-Image, FLUX.2-Klein y MiniMax H3.

comfyui-SelfLift porta el método SelfLift de resolución progresiva a ComfyUI: los primeros pasos de denoising se ejecutan a baja resolución, el latente intermedio se eleva a resolución completa y los pasos restantes terminan allí. No requiere entrenamiento ni un modelo adicional para la ruta de imagen.

Cómo SelfLift divide el schedule

Los modelos de pocos pasos como Z-Image-Turbo y FLUX.2-Klein comprimen el eje temporal, lo que hace que el costo espacial de cada pasada forward restante sea el término dominante. El muestreo de resolución progresiva reduce ese costo al hacer denoising primero a baja resolución. El problema que identifica el artículo de SelfLift (arXiv:2609.02036) es que simplemente elevar un latente y confiar en que los pocos pasos restantes absorban el desajuste deja artefactos visibles.

SelfLift, en cambio, deriva la señal de reparación del propio modelo: después de la elevación, una fracción de ubicaciones de alto riesgo se corrige hacia un ancla de píxeles-VAE, y la transición está diseñada para que el prefijo de baja resolución siga siendo una parte válida de la misma trayectoria. Los puntos de partida reportados en el artículo son 6 de 8 pasos a baja resolución para Z-Image-Turbo y 3 de 4 para FLUX.2-Klein.

Figura teaser de SelfLift mostrando el denoising con resolución progresiva

La figura teaser de SelfLift de la página del proyecto.

Tres nodos en un solo paquete

NodoClaseQué hace
Muestreador progresivo SelfLift (Imagen)SelfLiftImageSamplerMuestreo de resolución progresiva para modelos de imagen de flujo rectificado, usando el propio VAE del modelo
Muestreador progresivo SelfLift (MiniMax H3)SelfLiftH3SamplerAdaptación experimental de audio y vídeo de la misma idea para H3
H3 Temporal State Transport (TST)SelfLiftH3TSTUn parche de MODEL a MODEL que corrige el desequilibrio temporal en los vídeos de H3

Los muestreadores se conectan al cableado estándar de muestreadores de ComfyUI: aceptan una entrada sampler y sigmas como SamplerCustom, así que conectas KSamplerSelect configurado en euler y el propio scheduler del modelo. Otros muestreadores se rechazan a propósito.

Los parámetros principales son transition_step (cuántos pasos permanecen en baja resolución), lowres_scale (predeterminado 0.5), rho (la fracción de ubicaciones de alto riesgo atraídas hacia el ancla VAE; 0 lo desactiva), w_min / w_max para la fuerza de corrección, la interpolación de la elevación (nearest o bilinear) y un model_hires opcional para que la etapa de alta resolución pueda ejecutar un checkpoint o una pila de LoRA distintos. La transición no añade evaluaciones adicionales del denoiser: un schedule de N pasos sigue siendo exactamente N, más un ciclo de ida y vuelta de decodificación VAE, upscale y recodificación, a menos que rho sea 0.

Diagrama general de SelfLift

Resumen de SelfLift: prefijo de baja resolución, elevación del latente y etapa de alta resolución anclada.

La ruta de MiniMax H3

El autor marca explícitamente el muestreador H3 como experimental, y el artículo no lo valida. Ofrece dos rutas de elevación:

  • Upscaler externo (predeterminado): un upscaler de latentes H3 instalado con rho en 0, una elevación aprendida solo de latentes. Compatible con los pesos del upscaler de latentes H3, que el README acredita; el nodo toma un archivo h3 de models/latent_upscale_models/.
  • SelfLift-zero: upscaler_model establecido en none con rho mayor que 0. El punto de partida de H3 probado por el autor es rho 0.6 con w_min y w_max en 1, después de que una ejecución con una sola semilla encontrara que la configuración de imagen del artículo dejaba artefactos en la ruta de elevación directa de H3.

Una opción experimental highres_tiling divide la fase de alta resolución en 1 a 8 tiles espaciales. Solo conserva el audio del primer tile, no tiene atención entre tiles y no admite ControlNet, por lo que es un intercambio de memoria en lugar de un parámetro de calidad.

Transporte de estado temporal

TST es el segundo artículo portado aquí (arXiv:2609.08505). Mide una tensión espectral con signo del operador de atención a nivel de fotograma y corrige solo las cabezas desequilibradas, agudizando las demasiado mezcladas y suavizando las fragmentadas, con una corrección más fuerte en las capas más profundas y los pasos anteriores. Funciona con cualquier muestreador estándar, no solo con el muestreador SelfLift, y el autor reporta una sobrecarga de tiempo de ejecución de aproximadamente 1 a 2 por ciento.

En la práctica, apunta a los fallos que los usuarios notan más en la salida de H3: detalles que parpadean o se transforman, como texto y logotipos en pantalla, deriva de identidad de personas y vestuario, y movimiento físicamente implausible. tau es el parámetro de fuerza y 0.2 es el valor recomendado; 0.5 es visiblemente demasiado fuerte. No puede inventar detalles que el modelo no tiene, se aplica solo a modelos H3 y se omite cuando highres_tiling está activado. Una opción de registro imprime una línea de diagnóstico por cada forward del modelo, incluida la proporción de cabezas corregidas, que el autor midió como coincidente con el operador de atención exacto para el 89 al 100 por ciento de las cabezas.

Disponibilidad

Clona facok/comfyui-SelfLift en ComfyUI/custom_nodes y reinicia; todos los nodos aparecen bajo la categoría selflift. El paquete tiene documentación en inglés y chino, incluida una tabla de ajustes preestablecidos de diagnóstico para ajustar la ruta de elevación de H3.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
SelfLift trae el muestreo de resolución progresiva a ComfyUI | ComfyUI Wiki