Fizgig v6.5: LoRA para Qwen Image 2.1 con adaptador propio
Fizgig v6.5 añade entrenamiento LoRA y LoKR para Qwen Image 2.1 con adaptador propio, vistas previas turbo y un nuevo sistema de drivers. Las LoRAs se cargan en ComfyUI.
Fizgig v6.5.0, publicado el 27 de septiembre, convierte a Qwen Image 2.1 en un modelo base entrenable dentro del estudio (GitHub | notas de la versión | guía de Qwen Image 2.1). Fizgig ya entrena LoRAs, LoKRs y ajustes finos completos para Flux 2 Klein, Krea 2 y MiniMax H3. Esta versión lleva el mismo conjunto de herramientas al modelo de imagen de Qwen, y Qwen Image 2.1 es el primer modelo añadido mediante el nuevo sistema de drivers del estudio.
Fizgig: un banco de trabajo para entrenar, ajustar, reparar y explorar con Flux 2 Klein 9B, Krea 2, MiniMax H3 y ahora Qwen Image 2.1
Qué incluye el entrenamiento de Qwen Image 2.1
- Entrenamiento de LoRA o LoKR, con Adaptive LR o Automagic, EMA, Context LoRA, y pausar y reanudar.
- Vistas previas turbo durante el entrenamiento, impulsadas por el LoRA turbo de 6 pasos de Viggle. Fizgig lo ejecuta por debajo de su fuerza total de forma predeterminada, a 0.7 durante 10 pasos, tras descubrir en sus propias pruebas que esto supera a los 6 pasos predeterminados del turbo a plena fuerza.
- Una vigilancia de pérdida por imagen: detección de imágenes problemáticas, tasas de aprendizaje por imagen, un calentamiento para valores atípicos y recaptioning automático de imágenes atascadas con el mismo captioner Qwen3-VL que usa la pestaña Captions.
- Un panel de anulación de muestras en vivo dentro de una ejecución.
- Las cinco herramientas del banco de trabajo: Repair Studio, LoRA the Explorer, Profiler, Extract y LoRA Royale.
Los LoRAs y LoKRs guardados, los guardados de Repair Studio y las salidas de Extract se cargan mediante el cargador de LoRA estándar de ComfyUI.
El adaptador de entrenamiento propio de Fizgig
Los LoRAs de Qwen 2.1 tienen la costumbre de colapsar en textura o de tambalearse a mitad de una ejecución, y una pérdida más baja no te avisa de que está ocurriendo. La solución de Fizgig es un adaptador de entrenamiento: un LoRA pequeño que permanece congelado y activo mientras entrenas, se desactiva para las vistas previas y nunca acaba dentro de tu LoRA guardado, de modo que el resultado funciona sobre el modelo sin el adaptador. Se entrenó a una resolución mayor que el asistente de entrenamiento existente de Qwen 2.1, y el autor informa de que los LoRAs entrenados con él salen mucho más nítidos y además evitan el colapso. Está activado de forma predeterminada en todos los presets de Qwen y también está publicado para cualquier entrenador en Hugging Face.
Tres presets, un punto óptimo
Los tres presets entrenan a 0.5 MP con adamw8bit, EMA 0.98 y el adaptador de entrenamiento, durante 30 épocas, guardando en cada época:
| Preset | Rango | Tasa de aprendizaje | Para |
|---|---|---|---|
| Qwen 2.1 Fast (predeterminado) | 8 | Adaptive LR 2e-4 a 4e-4 | La mayoría de sujetos. El más rápido en alcanzar el parecido en las pruebas del autor, y el mejor conservando el detalle de la piel. |
| Qwen 2.1 Standard | 16 | Adaptive LR 1e-4 a 2e-4 | Conjuntos de datos más grandes o mixtos. El rango 16 con las tasas del preset Fast sobreentrena. |
| Qwen 2.1 Style | 16 | Plano 1.5e-4 | Estilos. Adaptive LR tiende a subir en los conjuntos de datos de estilo, que es donde los estilos se sobrecuecen. |
El razonamiento detrás de entrenar más rápido: Qwen genera imágenes muy nítidas desde el primer momento, y un LoRA arrastra el detalle fino, como la textura de la piel, hacia lo que tenga tu conjunto de datos, así que una ejecución larga con fotos más suaves cambia la nitidez de Qwen por la de ellas. 0.5 MP es medio millón de píxeles, unos 704×704 para una imagen cuadrada, y Fizgig agrupa cada imagen por forma con ese recuento de píxeles: 624×784 a 4:5, 576×848 a 2:3 y 528×928 a 9:16. Las épocas guardadas se pueden recorrer en LoRA Royale, así que si una época más tardía parece más suave, muchas veces la mejor elección es una anterior.
Tarjetas desde 10 GB
La precisión base y el tamaño de block swap se ajustan solos a partir de tu VRAM libre. Auto elige bf16 con 24 GB o más, INT8 con 12 a 16 GB, y NF4 de 4 bits con 10 GB, que es el mínimo para Qwen Image 2.1; el text encoder se cuantiza a 8 bits por debajo de unos 20 GB libres, que es lo que fija ese mínimo. En las pruebas del autor, una RTX 5090 limitada a 12 GB entrenó con INT8 con un pico de 9.9 GB, vistas previas incluidas, y limitada a 10 GB entrenó con NF4 con un pico de 7.3 GB.
El sistema de drivers
Qwen Image 2.1 es el primer modelo añadido mediante el nuevo sistema de drivers de Fizgig: un modelo se describe una sola vez, como sus archivos, su formato de LoRA y su código de modelo tras una interfaz estándar, y el entrenamiento, las vistas previas, las descargas, la planificación de memoria y las cinco herramientas del banco de trabajo funcionan a partir de esa descripción. Está prometida para la semana próxima una guía del sistema y pull requests abiertas para añadir más modelos.
Cómo conseguirlo
Pulsa Download models for me en la sección Qwen Image 2.1 de la pestaña Preferences para descargar el DiT, el VAE, el text encoder, el adaptador de entrenamiento y el LoRA turbo (unos 34 GB), además del captioner Qwen3-VL si no lo tienes, y luego elige Qwen Image 2.1 como Modelo base en la pestaña Training. La edición de entrenamiento para Qwen Image 2.1 figura como Próximamente.
.safetensors en formato kohya que se colocan directamente en ComfyUI/models/loras/.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.