Nvidia PiD v1.5 : Pixel Diffusion Decoder pour FLUX.2 et Qwen-Image

news

PiD v1.5 de Nvidia Research : meilleure qualité de décodage pour FLUX, FLUX.2 et Qwen-Image, couleurs plus fidèles, moins d'artefacts et détails renforcés.

PiD v1.5 (Pixel Diffusion Decoder) par Nvidia Research apporte des checkpoints mis à jour pour FLUX, FLUX.2 et Qwen-Image, avec une meilleure fidélité des couleurs, la suppression des artefacts en grille et des détails améliorés pour les visages et l'animation. Cette mise à jour introduit également une nouvelle variante de checkpoint recommandée 2kto4k_v1pt5 pour un décodage jusqu'en 4K.
PiD teaser - comparaison VAE vs PiD

Qu'est-ce que PiD ?

PiD (Pixel Diffusion Decoder) reformule le décodeur latent-à-pixel comme un modèle de diffusion conditionnel dans l'espace pixel, unifiant le décodage et le sur-échantillonnage en un seul module génératif. Au lieu du décodeur VAE standard qui se contente d'inverser l'encodeur, PiD débruit directement dans un espace pixel haute résolution et produit une image super-résolue en une seule passe.

Le décodeur VAE standard utilisé dans les modèles de diffusion latents (FLUX, SD3, SDXL) est orienté reconstruction — optimisé pour inverser l'encodeur plutôt que pour synthétiser des détails supplémentaires. PiD le remplace par une approche générative capable de produire des sorties plus nettes et plus détaillées à des résolutions plus élevées, tout en restant cohérent avec les latents générés.

Quoi de neuf dans la v1.5

PiD v1.5 apporte des améliorations ciblées sur trois espaces latents majeurs :

  • Fidélité des couleurs améliorée lors du décodage — reproduction plus précise des couleurs à partir des latents générés
  • Suppression des artefacts en grille dans les coins de l'image — sorties plus propres, surtout à haute résolution
  • Amélioration des détails pour l'animation et les visages — meilleur traitement des éléments structurels fins

Le nouveau checkpoint 2kto4k_v1pt5 est le décodeur recommandé jusqu'en 4K pour FLUX, FLUX.2 et Qwen-Image. Les anciens checkpoints 2kto4k pour ces modèles sont dépréciés et déplacés dans checkpoints_deprecated/.

Checkpoints disponibles

Tous les checkpoints PiD sont distillés en 4 étapes :

BackboneRésolution 2kRésolution 2k vers 4k
FLUXPiD_res2k_sr4x_flux_distill_4stepPiD_v1pt5_res2kto4k_sr4x_flux_distill_4step
FLUX.2PiD_res2k_sr4x_flux2_distill_4stepPiD_v1pt5_res2kto4k_sr4x_flux2_distill_4step
Qwen-ImagePiD_v1pt5_res2kto4k_sr4x_qwenimage_distill_4step

Les checkpoints 2kto4k v1.5 supportent également les variantes Z-Image, Z-Image-Turbo et FLUX.2-Klein (4B/9B).

Décodage VAE standardDécodage PiD v1.5
VAE standard (512×512)PiD v1.5 (2048×2048)

Comparaison : latents FLUX.2 décodés avec le VAE standard vs PiD v1.5 — meilleure fidélité des couleurs, moins d'artefacts et détails renforcés.

Comment ça fonctionne

PiD reformule le décodeur latent comme un processus de diffusion dans l'espace pixel :

  1. La représentation latente est d'abord projetée en une image pixel basse résolution via un encodeur léger
  2. Un modèle de diffusion conditionnel débruite cette image basse résolution, guidé par les caractéristiques latentes
  3. Le résultat est une image haute résolution et riche en détails en une seule passe — combinant décodage et sur-échantillonnage

Cette approche permet à PiD de générer des images jusqu'en résolution 4K directement à partir de représentations latentes standard, sans nécessiter d'étapes de sur-échantillonnage séparées.

Workflows prêts à l'emploi

Deux modèles officiels de la bibliothèque de workflows ComfyUI illustrent PiD en action :

PiD Latent Upscale — utilise PiD comme remplacement de décodeur/upscale latent pour les backbones FLUX, FLUX.2 et PixelDiT.

PixelDiT Text-to-Image — pipeline complet texte-vers-image utilisant PixelDiT comme backbone et PiD pour le décodage.

Pertinence pour ComfyUI

PiD est disponible dans ComfyUI via des nœuds personnalisés (ComfyUI-PiD) et est déjà intégré dans les workflows officiels. Le workflow PiD Latent Upscale permet d'utiliser PiD comme remplacement direct du décodeur VAE pour FLUX, FLUX.2 et PixelDiT, tandis que le workflow PixelDiT Text-to-Image illustre la génération de bout en bout avec le décodage PiD.

Le modèle est publié sous la licence NSCLv1 (recherche non commerciale ou évaluation uniquement).

Nvidia PiD sur HF Article sur arXiv Page du projet

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Nvidia PiD v1.5 : Pixel Diffusion Decoder pour FLUX.2 et Qwen-Image | ComfyUI Wiki