Nvidia PiD v1.5: decodificador de difusión para FLUX.2 y Qwen-Image
Nvidia Research lanza PiD v1.5 con calidad de decodificación mejorada para FLUX, FLUX.2 y Qwen-Image: mejor color, menos artefactos y detalles mejorados.
2kto4k_v1pt5 para decodificación de hasta 4K.
¿Qué es PiD?
PiD (Decodificador de difusión de píxeles) reformula el decodificador de latentes a píxeles como un modelo de difusión condicional en el espacio de píxeles, unificando la decodificación y el sobremuestreo en un solo módulo generativo. En lugar del decodificador VAE estándar que simplemente invierte el codificador, PiD elimina el ruido directamente en el espacio de píxeles de alta resolución y produce una imagen superresuelta en un solo paso.
El decodificador VAE estándar utilizado en los modelos de difusión latente (FLUX, SD3, SDXL) está orientado a la reconstrucción, optimizado para invertir el codificador en lugar de sintetizar detalles adicionales. PiD lo reemplaza con un enfoque generativo que puede generar salidas más nítidas y detalladas a resoluciones más altas, manteniendo la coherencia con los latentes generados.
Novedades en v1.5
PiD v1.5 trae mejoras específicas en tres espacios latentes principales:
- Fidelidad de color de decodificación mejorada — reproducción cromática más precisa a partir de latentes generados
- Eliminación de artefactos de cuadrícula en las esquinas de la imagen — salidas más limpias, especialmente a altas resoluciones
- Detalles de animación y rostros mejorados — mejor manejo de elementos estructurales finos
El nuevo punto de control 2kto4k_v1pt5 es el decodificador recomendado hasta 4K para FLUX, FLUX.2 y Qwen-Image. Los puntos de control 2kto4k anteriores para estos modelos están obsoletos y se han movido a checkpoints_deprecated/.
Puntos de control disponibles
Todos los puntos de control de PiD están destilados en 4 pasos:
| Columna vertebral | Resolución 2k | Resolución de 2k a 4k |
|---|---|---|
| FLUX | PiD_res2k_sr4x_flux_distill_4step | PiD_v1pt5_res2kto4k_sr4x_flux_distill_4step |
| FLUX.2 | PiD_res2k_sr4x_flux2_distill_4step | PiD_v1pt5_res2kto4k_sr4x_flux2_distill_4step |
| Qwen-Image | — | PiD_v1pt5_res2kto4k_sr4x_qwenimage_distill_4step |
Los puntos de control 2kto4k v1.5 también son compatibles con Z-Image, Z-Image-Turbo y las variantes FLUX.2-Klein (4B/9B).
![]() | ![]() |
|---|---|
| VAE estándar (512×512) | PiD v1.5 (2048×2048) |
Comparación: latentes de FLUX.2 decodificados con VAE estándar vs PiD v1.5 — mejor fidelidad de color, menos artefactos y detalles mejorados.
Cómo funciona
PiD reformula el decodificador latente como un proceso de difusión en el espacio de píxeles:
- La representación latente se proyecta primero a una imagen de píxeles de baja resolución mediante un codificador ligero
- Un modelo de difusión condicional elimina el ruido de esta imagen de baja resolución, guiado por las características latentes
- El resultado es una imagen de alta resolución y rica en detalles en un solo paso, combinando decodificación y sobremuestreo
Este enfoque permite que PiD genere imágenes de hasta resolución 4K directamente a partir de representaciones latentes estándar, sin necesidad de pasos de escalado por separado.
Flujos de trabajo listos para usar
Dos plantillas oficiales de la biblioteca de workflows de ComfyUI demuestran PiD en acción:
PiD Latent Upscale — aplica PiD como reemplazo de decodificador/upscale latente para backbones FLUX, FLUX.2 y PixelDiT.
PixelDiT Text-to-Image — pipeline completo de texto a imagen usando PixelDiT como backbone y PiD para decodificación.
Relevancia para ComfyUI
PiD está disponible en ComfyUI a través de nodos personalizados (ComfyUI-PiD) y ya está integrado en workflows oficiales. El workflow PiD Latent Upscale permite usar PiD como reemplazo directo del decodificador VAE para FLUX, FLUX.2 y PixelDiT, mientras que el workflow PixelDiT Text-to-Image muestra la generación de extremo a extremo con decodificación PiD.
El modelo se publica bajo la licencia NSCLv1 (solo investigación o evaluación no comercial).


Comentarios
Inicia sesión con GitHub para unirte a la conversación.