Nvidia PiD v1.5: decodificador de difusión para FLUX.2 y Qwen-Image

news

Nvidia Research lanza PiD v1.5 con calidad de decodificación mejorada para FLUX, FLUX.2 y Qwen-Image: mejor color, menos artefactos y detalles mejorados.

PiD v1.5 (Decodificador de difusión de píxeles) de Nvidia Research trae puntos de control actualizados para FLUX, FLUX.2 y Qwen-Image, con fidelidad de color mejorada, eliminación de artefactos de cuadrícula y detalles mejorados en caras y animación. La actualización también introduce una nueva variante de punto de control recomendada 2kto4k_v1pt5 para decodificación de hasta 4K.
PiD teaser - comparación VAE vs PiD

¿Qué es PiD?

PiD (Decodificador de difusión de píxeles) reformula el decodificador de latentes a píxeles como un modelo de difusión condicional en el espacio de píxeles, unificando la decodificación y el sobremuestreo en un solo módulo generativo. En lugar del decodificador VAE estándar que simplemente invierte el codificador, PiD elimina el ruido directamente en el espacio de píxeles de alta resolución y produce una imagen superresuelta en un solo paso.

El decodificador VAE estándar utilizado en los modelos de difusión latente (FLUX, SD3, SDXL) está orientado a la reconstrucción, optimizado para invertir el codificador en lugar de sintetizar detalles adicionales. PiD lo reemplaza con un enfoque generativo que puede generar salidas más nítidas y detalladas a resoluciones más altas, manteniendo la coherencia con los latentes generados.

Novedades en v1.5

PiD v1.5 trae mejoras específicas en tres espacios latentes principales:

  • Fidelidad de color de decodificación mejorada — reproducción cromática más precisa a partir de latentes generados
  • Eliminación de artefactos de cuadrícula en las esquinas de la imagen — salidas más limpias, especialmente a altas resoluciones
  • Detalles de animación y rostros mejorados — mejor manejo de elementos estructurales finos

El nuevo punto de control 2kto4k_v1pt5 es el decodificador recomendado hasta 4K para FLUX, FLUX.2 y Qwen-Image. Los puntos de control 2kto4k anteriores para estos modelos están obsoletos y se han movido a checkpoints_deprecated/.

Puntos de control disponibles

Todos los puntos de control de PiD están destilados en 4 pasos:

Columna vertebralResolución 2kResolución de 2k a 4k
FLUXPiD_res2k_sr4x_flux_distill_4stepPiD_v1pt5_res2kto4k_sr4x_flux_distill_4step
FLUX.2PiD_res2k_sr4x_flux2_distill_4stepPiD_v1pt5_res2kto4k_sr4x_flux2_distill_4step
Qwen-ImagePiD_v1pt5_res2kto4k_sr4x_qwenimage_distill_4step

Los puntos de control 2kto4k v1.5 también son compatibles con Z-Image, Z-Image-Turbo y las variantes FLUX.2-Klein (4B/9B).

Decodificación VAE estándarDecodificación PiD v1.5
VAE estándar (512×512)PiD v1.5 (2048×2048)

Comparación: latentes de FLUX.2 decodificados con VAE estándar vs PiD v1.5 — mejor fidelidad de color, menos artefactos y detalles mejorados.

Cómo funciona

PiD reformula el decodificador latente como un proceso de difusión en el espacio de píxeles:

  1. La representación latente se proyecta primero a una imagen de píxeles de baja resolución mediante un codificador ligero
  2. Un modelo de difusión condicional elimina el ruido de esta imagen de baja resolución, guiado por las características latentes
  3. El resultado es una imagen de alta resolución y rica en detalles en un solo paso, combinando decodificación y sobremuestreo

Este enfoque permite que PiD genere imágenes de hasta resolución 4K directamente a partir de representaciones latentes estándar, sin necesidad de pasos de escalado por separado.

Flujos de trabajo listos para usar

Dos plantillas oficiales de la biblioteca de workflows de ComfyUI demuestran PiD en acción:

PiD Latent Upscale — aplica PiD como reemplazo de decodificador/upscale latente para backbones FLUX, FLUX.2 y PixelDiT.

PixelDiT Text-to-Image — pipeline completo de texto a imagen usando PixelDiT como backbone y PiD para decodificación.

Relevancia para ComfyUI

PiD está disponible en ComfyUI a través de nodos personalizados (ComfyUI-PiD) y ya está integrado en workflows oficiales. El workflow PiD Latent Upscale permite usar PiD como reemplazo directo del decodificador VAE para FLUX, FLUX.2 y PixelDiT, mientras que el workflow PixelDiT Text-to-Image muestra la generación de extremo a extremo con decodificación PiD.

El modelo se publica bajo la licencia NSCLv1 (solo investigación o evaluación no comercial).

Nvidia PiD en HF Artículo en arXiv Página del proyecto

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Nvidia PiD v1.5: decodificador de difusión para FLUX.2 y Qwen-Image | ComfyUI Wiki