Nvidia PiD v1.5 : Pixel Diffusion Decoder pour FLUX.2 et Qwen-Image
PiD v1.5 de Nvidia Research : meilleure qualité de décodage pour FLUX, FLUX.2 et Qwen-Image, couleurs plus fidèles, moins d'artefacts et détails renforcés.
2kto4k_v1pt5 pour un décodage jusqu'en 4K.
Qu'est-ce que PiD ?
PiD (Pixel Diffusion Decoder) reformule le décodeur latent-à-pixel comme un modèle de diffusion conditionnel dans l'espace pixel, unifiant le décodage et le sur-échantillonnage en un seul module génératif. Au lieu du décodeur VAE standard qui se contente d'inverser l'encodeur, PiD débruit directement dans un espace pixel haute résolution et produit une image super-résolue en une seule passe.
Le décodeur VAE standard utilisé dans les modèles de diffusion latents (FLUX, SD3, SDXL) est orienté reconstruction — optimisé pour inverser l'encodeur plutôt que pour synthétiser des détails supplémentaires. PiD le remplace par une approche générative capable de produire des sorties plus nettes et plus détaillées à des résolutions plus élevées, tout en restant cohérent avec les latents générés.
Quoi de neuf dans la v1.5
PiD v1.5 apporte des améliorations ciblées sur trois espaces latents majeurs :
- Fidélité des couleurs améliorée lors du décodage — reproduction plus précise des couleurs à partir des latents générés
- Suppression des artefacts en grille dans les coins de l'image — sorties plus propres, surtout à haute résolution
- Amélioration des détails pour l'animation et les visages — meilleur traitement des éléments structurels fins
Le nouveau checkpoint 2kto4k_v1pt5 est le décodeur recommandé jusqu'en 4K pour FLUX, FLUX.2 et Qwen-Image. Les anciens checkpoints 2kto4k pour ces modèles sont dépréciés et déplacés dans checkpoints_deprecated/.
Checkpoints disponibles
Tous les checkpoints PiD sont distillés en 4 étapes :
| Backbone | Résolution 2k | Résolution 2k vers 4k |
|---|---|---|
| FLUX | PiD_res2k_sr4x_flux_distill_4step | PiD_v1pt5_res2kto4k_sr4x_flux_distill_4step |
| FLUX.2 | PiD_res2k_sr4x_flux2_distill_4step | PiD_v1pt5_res2kto4k_sr4x_flux2_distill_4step |
| Qwen-Image | — | PiD_v1pt5_res2kto4k_sr4x_qwenimage_distill_4step |
Les checkpoints 2kto4k v1.5 supportent également les variantes Z-Image, Z-Image-Turbo et FLUX.2-Klein (4B/9B).
![]() | ![]() |
|---|---|
| VAE standard (512×512) | PiD v1.5 (2048×2048) |
Comparaison : latents FLUX.2 décodés avec le VAE standard vs PiD v1.5 — meilleure fidélité des couleurs, moins d'artefacts et détails renforcés.
Comment ça fonctionne
PiD reformule le décodeur latent comme un processus de diffusion dans l'espace pixel :
- La représentation latente est d'abord projetée en une image pixel basse résolution via un encodeur léger
- Un modèle de diffusion conditionnel débruite cette image basse résolution, guidé par les caractéristiques latentes
- Le résultat est une image haute résolution et riche en détails en une seule passe — combinant décodage et sur-échantillonnage
Cette approche permet à PiD de générer des images jusqu'en résolution 4K directement à partir de représentations latentes standard, sans nécessiter d'étapes de sur-échantillonnage séparées.
Workflows prêts à l'emploi
Deux modèles officiels de la bibliothèque de workflows ComfyUI illustrent PiD en action :
PiD Latent Upscale — utilise PiD comme remplacement de décodeur/upscale latent pour les backbones FLUX, FLUX.2 et PixelDiT.
PixelDiT Text-to-Image — pipeline complet texte-vers-image utilisant PixelDiT comme backbone et PiD pour le décodage.
Pertinence pour ComfyUI
PiD est disponible dans ComfyUI via des nœuds personnalisés (ComfyUI-PiD) et est déjà intégré dans les workflows officiels. Le workflow PiD Latent Upscale permet d'utiliser PiD comme remplacement direct du décodeur VAE pour FLUX, FLUX.2 et PixelDiT, tandis que le workflow PixelDiT Text-to-Image illustre la génération de bout en bout avec le décodage PiD.
Le modèle est publié sous la licence NSCLv1 (recherche non commerciale ou évaluation uniquement).


Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.