AcademiaSD LoRAlab: nueve entrenadores LoRA en un solo lanzador

ComfyUI Wikinews

AcademiaSD LoRAlab Trainer Studio reúne entrenadores LoRA para Qwen-Image 2.1, FLUX.2 Klein, Krea 2, Z-Image, MiniMax-H3 y más en un único lanzador, desde 4 GB de VRAM.

AcademiaSD LoRAlab Trainer Studio reúne nueve entrenadores LoRA en un solo lanzador y un único entorno de Python: Qwen-Image 2.1, FLUX.2 Klein 9B, Krea 2, Z-Image, Ideogram 4, Anima, SDXL, LTX-2.3 y MiniMax-H3. Cada modelo se carga en NF4 de 4 bits, y cada entrenador tiene la misma interfaz web, desde el administrador de datasets hasta la exportación con un clic a tu carpeta models/loras de ComfyUI.
El lanzador de LoRAlab Trainer Studio

El lanzador: elige un entrenador y se abre en el navegador, mientras los modelos, los proyectos y las configuraciones se mantienen compartidos.

Qué entrena y con cuánta VRAM

EntrenadorEntrenaVRAM mínima
Qwen-Image 2.1LoRAs de personaje, objeto y estilo, además de LoRAs de edición (antes → después)8 GB
Krea 2LoRAs de personaje, objeto y estilo para Krea 2 Raw y Turbo8 GB
Z-ImageLoRAs de personaje, objeto y estilo para Z-Image y Z-Image-Turbo8 GB
AnimaLoRAs de personaje y estilo de anime e ilustración4 GB (NF4) / 6 GB (BF16)
FLUX.2 Klein 9BLoRAs de personaje, objeto y estilo, además de LoRAs de edición12 GB
Ideogram 4LoRAs de personaje, objeto y estilo, con captions en JSON12 GB
SDXLLoRAs para SDXL Base, Pony, Illustrious, NoobAI y otros checkpoints SDXL4 GB (NF4) / 12 GB (BF16)
LTX-2.3 (y LTX-2.5)LoRAs de personaje y estilo para el modelo de vídeo LTX, entrenados a partir de imágenes12 GB
MiniMax-H3LoRAs de vídeo a partir de imágenes, clips y audio, además de RefMods sin entrenamiento8 GB

El mínimo es una GPU NVIDIA con capacidad de cómputo 7.5 o superior (RTX 20xx / GTX 16xx en adelante), un controlador de la serie 580 o superior para CUDA 13 y 16 GB de RAM del sistema. Los clips de vídeo de MiniMax-H3 necesitan además ffmpeg en el PATH. Las tarjetas GTX 10xx quedan fuera: PyTorch para CUDA 13 comienza en la generación RTX 20xx.

Una interfaz por entrenador

La interfaz del entrenador Qwen-Image 2.1

El entrenador Qwen-Image 2.1. Los nueve entrenadores comparten los mismos paneles.

Todos los entrenadores siguen los mismos cinco pasos:

  1. Proyecto y dataset. Ponle nombre al proyecto, añade una palabra de activación opcional y apunta a una carpeta de dataset. Cada imagen necesita un caption .txt con el mismo nombre, y las imágenes se pueden arrastrar como carpeta o como .zip.
  2. Captions (opcional). Un modelo de visión-lenguaje escribe un caption para cada imagen con la palabra de activación al principio; el prompt es editable y los captions existentes se conservan a menos que los sobrescribas.
  3. Precaché. El codificador de texto y el VAE se ejecutan una vez a la resolución elegida y sus resultados se guardan en disco. Al volver a ejecutar se omiten las imágenes que no han cambiado y, después, el 100 % de la GPU se dedica al entrenamiento.
  4. Entrenar. Configura los pasos, la tasa de aprendizaje, el rango y el alfa, y luego comienza. Las configuraciones se pueden cambiar durante la ejecución y se aplican en el siguiente paso, y Detener entrenamiento guarda el paso exacto, así que una ejecución se reanuda días más tarde sin perder ni un paso.
  5. Exportar. Send to Models copia el LoRA en una carpeta models/loras de ComfyUI (o Forge / A1111) que el estudio recuerda entre entrenadores. Los checkpoints por paso también se pueden descargar desde el navegador, y los LoRA exportados llevan metadatos estilo kohya que Civitai y los administradores de LoRA leen.

El estudio también funciona desde otra máquina en la misma red: el lanzador tiene un modo de acceso remoto con nombre de usuario y contraseña, así que se puede subir un dataset desde un portátil y descargar de vuelta el LoRA entrenado sin tocar el PC de entrenamiento.

Vistas previas nítidas durante el entrenamiento

Algunos de estos modelos son lo bastante lentos como para que haya que vigilar el muestreo, y la vista previa predeterminada Latent2RGB de ComfyUI para Qwen-Image 2.1, Krea 2 y FLUX.2 es color a bloques. La pareja recomendada en el README es KJNodes de kijai más los pequeños autoencoders de AcademiaSD en ComfyUI/models/vae_approx/: TAE-Qwen-Image-2.1, TAE-Krea-2 y TAE_Flux2_AcademiaSD, colocados en el nodo Model Preview Override entre el modelo y el muestreador.

Instalar

Un instalador por plataforma y un venv compartido para todos los entrenadores (PyTorch 2.14 sobre CUDA 13.0, Diffusers desde GitHub, Transformers, PEFT, bitsandbytes y Flask):

git clone https://github.com/AcademiaSD/AcademiaSD_LoRAlab-TrainerStudio.git

En Windows, haz doble clic en Install_LoRAlab-TrainerStudio.bat; en Linux cada .bat tiene su equivalente .sh, y el lanzador elige el correcto. Install_Triton&SageAtten220.bat añade Triton y SageAttention 2.2 si los quieres. Actualizar es un solo Update_LoRAlab-TrainerStudio.bat, que conserva modelos, datasets, proyectos y configuraciones. El proyecto también incluye una plantilla de RunPod y una imagen de Docker para entrenamiento en la nube.

La interfaz del entrenador MiniMax-H3

El entrenador MiniMax-H3, uno de los dos entrenadores de vídeo del estudio.

El autor señala que el estudio es un trabajo temprano: los entrenadores se añadieron en rápida sucesión, por lo que las configuraciones predeterminadas de entrenamiento y vista previa pueden no ser adecuadas para todos los modelos, y los problemas son la forma prevista de reportar lo que falla.

Disponibilidad

AcademiaSD LoRAlab Trainer Studio está en github.com/AcademiaSD/AcademiaSD_LoRAlab-TrainerStudio, con paquetes de entrenamiento pre-cuantizados como AcademiaSD/Qwen-Image-2.1-NF4-for-LoRA-Training en Hugging Face.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
AcademiaSD LoRAlab: nueve entrenadores LoRA en un solo lanzador | ComfyUI Wiki