Qwen-Image 2.1 Fun Acc LoRA: destilación oficial en 4 pasos
Alibaba PAI destila Qwen-Image 2.1 a 4 pasos con un LoRA PDD de 346 MB que cubre texto a imagen y edición por instrucciones, con su propio schedule sigma.
El adaptador sigue la misma receta que Alibaba PAI usó para los MiniMax H3 PDD Acc LoRAs en agosto: tomar un modelo base potente, destilarlo con Destilación por Decodificación Paralela (PDD, arXiv 2607.26004) y publicar el LoRA extraído junto con el código de inferencia necesario para reproducir los resultados de referencia. Qwen-Image 2.1 se lanzó el 20 de septiembre de 2026 y ya cuenta con soporte en ComfyUI, así que se trata de una variante de aceleración de un modelo que apenas tiene unos días.
Qué incluye el repositorio
| Adaptador | models/Qwen-Image-2.1-Fun-Acc-4Step.safetensors, 346 MB, rank 64 y network_alpha 64 en BF16 |
| Modelo base | Qwen-Image 2.1 (Qwen/Qwen-Image-2.1), pesos sin cambios |
| Pasos | 4 NFE (pdd_num_steps: 4, pdd_block_size: 1) |
| Tareas | Texto a imagen y edición de imágenes basada en instrucciones |
| Objetivos entrenados | img_in, modulation.1, norm_out.linear, los embedders de timestep, attn.to_q/to_k/to_v/to_out.0 e img_mlp de los 32 bloques del transformer, además de txt_in.in_layer / txt_in.out_layer |
| Extras solo de inferencia | La atención norm_q / norm_k y txt_in.text_norm se almacenan como parámetros completos en lugar de pares LoRA |
| Tamaño de muestra por defecto | 2048 x 2048 (pdd_sample_size) |
| Precisión de muestreo | native_time_fp32_state |
El schedule sigma forma parte del lanzamiento y no es un detalle de implementación: pdd_config.json fija el schedule de cuatro pasos en 1.0, 0.9169867, 0.7861579, 0.549491, 0.0, y el formato exportado es qwenimage21_extracted_prefused_v1. Esos números son la razón por la que este no es un LoRA que se pueda usar sin más. Un muestreador genérico de 4 pasos con sigmas por defecto no reproduce el comportamiento destilado.
Cómo se compara
La ficha del modelo publica comparativas de tres vías para cada ejemplo: el teacher a 40 NFE, el PDD LoRA a 4 NFE y Viggle v0.1 full a 4 NFE. PDD no solo se compara con su propio teacher, sino también con la otra ruta de 4 pasos para este modelo, que es el LoRA turbo de Viggle publicado a principios de septiembre.
![]() | ![]() | ![]() |
|---|---|---|
| Teacher: 40 NFE | PDD LoRA: 4 NFE | Viggle v0.1 full: 4 NFE |
Muestra de texto a imagen, prompt tomado del artículo de PDD. Los tres paneles usan la semilla 42.
La edición está cubierta por el mismo adaptador, incluidas las ediciones con múltiples referencias. El ejemplo siguiente vuelve a dibujar la bandera de la imagen de referencia, y la tercera columna es la misma ruta de 4 pasos servida por el LoRA turbo de Viggle.
![]() | ![]() | ![]() | ![]() |
|---|---|---|---|
| Imagen de referencia | Teacher: 40 NFE | PDD LoRA: 4 NFE | Viggle v0.1 full: 4 NFE |
![]() | ![]() | ![]() |
|---|---|---|
| Teacher: 40 NFE | PDD LoRA: 4 NFE | Viggle v0.1 full: 4 NFE |
Muestra de edición con dos referencias (persona y gato), semilla 43.
Limitaciones documentadas
La ficha del modelo enumera dos carencias conocidas frente al teacher en lugar de dejar que se descubran por cuenta propia:
- El texto denso y pequeño puede degradarse de forma notable, con trazos de caracteres distorsionados y menor legibilidad.
- Algunas salidas de edición se ven algo más borrosas y oscuras que las del teacher, con menor claridad en los detalles finos.
Disponibilidad
No hay soporte oficial en ComfyUI, y el lanzamiento está escrito para el pipeline oficial:
- Solo Diffusers: mantén
qwenimage21_pdd.pyylora_utils_pdd.py, incluidos en el paquete, junto a los scripts y ejecutapython predict_t2i.py(generación) opython predict_t2i_edit.py(edición). - VideoX-Fun: usa una copia del repositorio que exponga
QwenImage21Pipelinedesdevideox_fun.pipeliney ejecutapredict_t2i_videox_fun.pyopredict_t2i_edit_videox_fun.py.
Para ComfyUI solo existe por ahora una ruta experimental: Kijai publicó una rama Qwen-Image 2.1 PDD del repositorio de ComfyUI, y el LoRA necesita conversión antes de que un loader de ComfyUI pueda usarlo. Dado que el schedule y los parámetros norm_q / norm_k / text_norm que no forman parte del LoRA son parte de la destilación, considera las conversiones de este adaptador para ComfyUI como trabajo de la comunidad y no como una ruta con soporte.
Los adaptadores de aceleración anteriores del mismo equipo para MiniMax H3 son el punto de referencia más cercano para entender cómo funciona esta familia de lanzamientos: ahí también el LoRA destilado se publicó con su propia receta de inferencia en lugar de como un LoRA estándar para el modelo base.










Comentarios
Inicia sesión con GitHub para unirte a la conversación.