El LoRA SDA de Krea 2 Turbo Restaura la Diversidad de Muestreo

ComfyUI Wikinews

F16 publica un LoRA de Krea 2 Turbo entrenado con Alineación Direccional Semántica: el mismo prompt genera resultados distintos en cada semilla, sin pérdida de calidad.

LoRA de Diversidad SDA Krea 2 Turbo v1.0 (Hugging Face) de F16 corrige una desventaja conocida de los modelos rápidos destilados: Krea 2 Turbo regenera casi la misma Imagen a partir del mismo prompt entre Semillas. Este LoRA de rango 32 restaura esa diversidad de Semillas sin dañar la calidad de Imagen ni la adherencia al prompt, medido con un aumento del +85% en la distancia CLIP por pares con calidad HPSv2.1 equivalente.

La ilustración más clara son 16 Semillas de "un gato sentado en el alféizar de una Ventana". El Turbo de referencia redibuja el mismo gato atigrado y Blanco cada vez. Con el LoRA Activo, las Semillas varían los patrones del pelaje, la iluminación, la estación e incluso el entorno de la Ventana:

Referencia: 16 Semillas, un gatoCon LoRA SDA: 16 Semillas, 16 gatos
Turbo de referencia: el mismo gato 16 vecesCon el LoRA SDA: pelaje, luz y Configuraciones variados

El mismo patrón se aplica a naturalezas muertas (una plantilla de piña vs composiciones variadas) y retratos (el mismo encuadre de retrato de estudio vs diferentes edades, cabello y escenas).

Cómo funciona SDA

Diagrama del principio SDA

Alineación Direccional Semántica trata el Colapsar de la diversidad como un problema de dirección. Para una Imagen de entrenamiento, se extraen dos ruidos aleatorios y se les añade ruido hasta sigma 0.9567, el paso más alto aprendible del programa de 8 pasos de Turbo donde se decide la composición. El profesor congelado (Krea 2 RAW, el padre no destilado) y el estudiante (Turbo más el LoRA) predicen cada uno cómo sería la Imagen para ambos ruidos, y una pila CLIP congelada incorpora las predicciones. El cambio en la dirección perceptiva del profesor registra cómo un intercambio de ruido debería mover la Imagen; la pérdida enseña la dirección del estudiante a coincidir con ella en lugar de Colapsar todos los ruidos en una plantilla. Una exploración de candidatos mejor de 5 añade aproximadamente 3 veces la velocidad de aprendizaje.

El entrenamiento utilizó solo 109 Imágenes a 1024x1024, lo que explica cómo un adaptador pequeño puede cambiar la composición sin desviar el estilo.

La puerta importa: 2 pasos, luego apagado

El LoRA se entrenó en un único Nodo de alto ruido, por lo que solo debe estar Activo durante los primeros 2 de los 8 pasos de eliminación de ruido. Las mediciones del Autor:

Puerta (pasos Activos de 8)Resultado
1Funciona, pero 20% menos diversidad
2Configuración prevista, todos los números Arriba
8 (siempre Activo)Colapso de calidad: ruido o desenfoque, -10% HPS

El ComfyUI estándar aplica LoRAs en cada paso, por lo que se Requerido un Nodo de programación de LoRA por paso (ganchos o Nodos Personalizados de programación) para Cambiar el adaptador DESPUÉS del paso 2. El Repositorio también incluye un Flujo de trabajo Listo, Krea2_turbo_sda_workflow.json, construido alrededor del ClownsharKSampler Beta con la puerta conectada.

Archivos

ArchivoTamañoUso
krea2_turbo_sda_v1.0_comfy.safetensors447 MBFormato de clave ComfyUI
krea2_turbo_sda_v1.0_diffusers.safetensors447 MBKrea2Pipeline de diffusers

El fragmento de pipeline de diffusers en la tarjeta del modelo implementa la puerta como una devolución de llamada de paso de una línea. Se Incluido una tarjeta de modelo en chino en el Repositorio.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
El LoRA SDA de Krea 2 Turbo Restaura la Diversidad de Muestreo | ComfyUI Wiki