Qwen-Image 2.1 Consistency LoRA: ediciones bien encuadradas

ComfyUI Wikinews

Un LoRA comunitario para Qwen-Image 2.1 mantiene las ediciones en el encuadre original: mismo prompt y semilla regresan sin desviación ni repintado, con dos flujos de ComfyUI.

Qwen-Image 2.1 Consistency LoRA (Hugging Face) es un adaptador de la comunidad que mantiene una edición sobre el encuadre de la imagen original. Pide a Qwen-Image 2.1 una versión en acuarela o en cómic de una foto y el resultado suele volver unos puntos porcentuales más alto, desplazado hacia un lado y distinto para cada semilla. Este LoRA entrena esa desviación hasta eliminarla: mismo prompt, misma semilla y el resultado se alinea con la fuente. ausboss publicó los pesos el 27 de septiembre junto con dos checkpoints, dos flujos de trabajo de ComfyUI y las mediciones de desviación que los respaldan.
Un reestilizado en acuarela donde la pintura se dibuja más alta sin el LoRA y se mantiene sobre la línea original con él

La línea discontinua marca dónde se sitúa un elemento en el original y la flecha muestra cuánto se movió. Mismo prompt y semilla en cada columna, renderizado en ComfyUI sobre los pesos INT8 de Qwen-Image 2.1 de Comfy-Org.

Qué corrige

Cada edición con Qwen-Image 2.1 es una generación nueva, así que el modelo recompone toda la imagen en lugar de cambiar solo la parte que pediste. En un reestilizado global eso se manifiesta como desviación: una cintura 40 px más abajo, un horizonte 25 px más arriba, una cara que ya no se alinea con el original. En una edición local se manifiesta como repintado, donde mechones de pelo, carteles y texturas fuera de la edición se vuelven a dibujar junto con ella.

El LoRA hace que la edición ocurra sobre el encuadre del original. No hay palabra de activación. Cárgalo, escribe la instrucción de edición como siempre y los píxeles fuera del cambio se quedan donde estaban.

Desviación medida

La ficha del modelo reporta las cifras de ediciones de validación que nunca estuvieron en el conjunto de entrenamiento. Los desplazamientos corresponden a la peor esquina de la imagen medida contra el original, y la columna de estilo compara cada render con el aspecto del Qwen-Image 2.1 sin LoRA, donde una distancia menor indica una coincidencia más cercana:

ediciones de validación, Qwen 2.1 sin LoRA vs el LoRAsin LoRApaso 1500paso 2000
reestilizados (36): peor esquina desviada, mediana24.3 px1.6 px0.9 px
reestilizados: peor esquina desviada, peor caso61.1 px12.9 px3.5 px
reestilizados con menos de 3 px de desviación3 %75 %97 %
reestilizados (15): distancia de color vs el aspecto de Qwen sin LoRA7.06.310.9
reiluminados y ediciones locales (12): peor esquina desviada, mediana0.7 px0.1 px0.1 px

Dos semillas de Qwen-Image 2.1 sin LoRA difieren entre sí en 7.0 en esa escala de color, así que los reestilizados del paso 1500 se parecen al Qwen sin LoRA tanto como el Qwen sin LoRA se parece a sí mismo. El paso 2000 se alinea con más precisión, pero empieza a cambiar el aspecto: papel más blanco y menos color en tinta y aguada.

Un segundo conjunto mide el repintado en lugar de la desviación, sobre 18 ediciones de recoloreado y eliminación de fotos de validación. Cada render se alinea primero con su original, así que lo que se cuenta es repintado real, no desplazamiento:

Un recoloreado de una esquina de calle donde Qwen sin LoRA repinta el pelo, el cartel del local y el semáforo, mientras que el LoRA los deja intactos
fuera del objeto editadosin LoRApaso 1500paso 2000
píxeles que cambiaron de forma notable12.8 %7.5 %7.5 %
PSNR contra el original27.7 dB31.6 dB31.7 dB

Como referencia, codificar y decodificar una imagen solo a través del VAE de Qwen-Image 2.1 cambia alrededor del 2 % de los píxeles a 37 dB, así que ese es el mínimo. La edición en sí siguió ocurriendo en los 18 casos, con y sin el LoRA.

Una esquina de calle renderizada como página de cómic, donde Qwen sin LoRA estira la escena y el LoRA la mantiene en su sitio Una carretera costera reestilizada como página de cómic, donde Qwen sin LoRA eleva el horizonte y el LoRA lo mantiene sobre la línea

Una ejecución comparativa, lado a lado, de las mismas ediciones con y sin el LoRA, tomada de la ficha del modelo.

¿Paso 1500 o paso 2000?

archivonotas
qwen-image-2.1-consistency.safetensorspaso 1500, el punto de partida recomendado. Conserva el aspecto propio de Qwen.
qwen-image-2.1-consistency-2000.safetensorspaso 2000: la alineación más precisa, pero las pinturas salen un poco más pálidas.

Ambos son de rango 32 y usan la nomenclatura de claves de ComfyUI (diffusion_model.transformer_blocks.*), y los 384 tensores se cargan sobre los pesos de Qwen-Image 2.1 de Comfy-Org.

Cómo ejecutarlo en ComfyUI

El adaptador es un LoRA solo de modelo, así que no se necesitan Nodos Personalizados. Para añadirlo a cualquier gráfico de edición de Qwen-Image 2.1:

  1. Coloca el archivo .safetensors en ComfyUI/models/loras/ y añade un nodo LoraLoaderModelOnly justo después del cargador de modelo con fuerza 1.0. Fuerzas más bajas dejan que parte de la desviación regrese.
  2. Usa un nodo Text Encode Qwen Image 2.1 con tu imagen como image_1, resolution 0 y la instrucción de edición como prompt.
  3. Muestrea sobre la salida latent del codificador con KSampler a 25 pasos, CFG 1, euler y simple, denoise 1. Un latente de cualquier otro tamaño hace que Qwen aplique zoom según la relación de tamaño, algo que ningún LoRA puede deshacer.
  4. Decodifica con Decodificación VAE y después Dividir Imagen con Alfa, ya que el VAE de Qwen-Image 2.1 decodifica en RGBA.

El gráfico de ejemplo Qwen-Image 2.1 Edit del paquete es del que provienen estas cifras. El repositorio incluye dos flujos de trabajo listos para usar:

El segundo flujo de trabajo desactiva el LoRA y en su lugar usa un nodo Realign to Source para alinear de nuevo la edición finalizada con el original, que es el mejor camino para ediciones que necesitan mover algo. Ambos se construyeron con los nodos ComfyUI-AusBoss del autor, pero la ficha señala que cualquier nodo equivalente sirve.

Cómo se entrenó

El conjunto de datos se construye a partir de ediciones reales de Qwen-Image 2.1, con la desviación medida y restada de cada objetivo para que cada ejemplo de entrenamiento quede sobre el encuadre de su fuente:

  • 950 pares de edición de 257 imágenes: 110 retratos renderizados con Qwen-Image 2.1 para este conjunto de datos, 133 fotos de Unsplash y 14 imágenes seleccionadas a mano de las carpetas de referencia del autor.
  • Tipos de pares: pares directos (imagen a edición), pares inversos (edición de vuelta a imagen) y ediciones locales que conservan los píxeles del original en todo lo que queda fuera del objeto editado.
  • Entrenamiento: ostris/ai-toolkit con arch: qwen_image_2 sobre la base INT8 ConvRot de Comfy-Org, con la referencia mantenida al tamaño del objetivo. Rango 32, alpha 32, AdamW8bit con lr 1e-4, lote 1, timesteps con shift, resolución objetivo 1408. 3000 pasos en una H100 tomaron alrededor de 1.9 s por paso, con checkpoints cada 250.

Limitaciones

La ficha es directa sobre lo limitado del lanzamiento. En una actualización del 28 de septiembre, el autor escribe que el conjunto de datos puede haber sobreajustado el LoRA en ciertos tipos de ediciones, y que puede ignorar solicitudes que requieren movimiento real, como una nueva pose o una cabeza girada. Se planea una v2 una vez que se arme un nuevo conjunto de datos y, hasta entonces, el flujo de trabajo de realineación es el camino recomendado para esas ediciones.

Las demás limitaciones declaradas:

  • Aún no se ha probado con LoRAs turbo de 4 u 8 pasos, a 2 MP, ni con CFG superior a 1.
  • Los reestilizados de cómic y anime redibujan cada contorno, así que algunas formas todavía pueden desplazarse unos pocos píxeles por su cuenta. El peor reestilizado en el paso 1500 se desvió 12.9 px en una esquina.
  • Mantiene la imagen en su sitio. No hace más fuerte una edición débil: si el Qwen sin LoRA no realiza la edición en absoluto, el LoRA no cambiará eso.

Disponibilidad

Descargar qwen-image-2.1-consistency.safetensors (152 MB)

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Qwen-Image 2.1 Consistency LoRA: ediciones bien encuadradas | ComfyUI Wiki