Nvidia PiD v1.5: Pixel Diffusion Decoder for FLUX.2 and Qwen-Image
Nvidia Research releases PiD v1.5 with improved decoding quality for FLUX, FLUX.2, and Qwen-Image — better color, fewer artifacts, and enhanced detail.
2kto4k_v1pt5模型变体,用于最高4K解码。
PiD是什么?
PiD(像素扩散解码器)将Latent到像素的解码器重新构造为条件像素空间扩散模型,将解码和上采样统一为一个生成模块。与标准VAE解码器(仅反转编码器)不同,PiD直接在高分辨率像素空间中进行去噪,并在一次传递中生成超分辨率图像。
潜在扩散模型(FLUX、SD3、SDXL)中使用的标准VAE解码器是面向重建的——优化用于反转编码器而不是合成额外细节。PiD取而代之采用生成式方法,能够在更高分辨率下生成更清晰、更详细的输出,同时保持与已生成Latent的一致性。
v1.5的新特性
PiD v1.5在三个主要Latent空间上带来了有针对性的改进:
- 改进的解码颜色保真度——从已生成Latent中更准确地还原颜色
- 消除图像角落的网格伪影——输出更干净,尤其是在高分辨率下
- 改进的动漫和面部细节——更好地处理精细结构元素
新的**2kto4k_v1pt5**模型是FLUX、FLUX.2和Qwen-Image推荐的最高4K解码器。这些模型的上一个2kto4k模型已弃用,并移至checkpoints_deprecated/。
可用模型
所有PiD模型均为4步蒸馏:
| 主干模型 | 2K分辨率 | 2K转4K分辨率 |
|---|---|---|
| FLUX | PiD_res2k_sr4x_flux_distill_4step | PiD_v1pt5_res2kto4k_sr4x_flux_distill_4step |
| FLUX.2 | PiD_res2k_sr4x_flux2_distill_4step | PiD_v1pt5_res2kto4k_sr4x_flux2_distill_4step |
| Qwen-Image | — | PiD_v1pt5_res2kto4k_sr4x_qwenimage_distill_4step |
v1.5的2kto4k模型还支持Z-Image、Z-Image-Turbo和FLUX.2-Klein(4B/9B)变体。
![]() | ![]() |
|---|---|
| 标准 VAE(512×512) | PiD v1.5(2048×2048) |
对比:FLUX.2 Latent 经标准 VAE 解码与 PiD v1.5 解码的效果 — PiD 在颜色保真度、伪影消除和细节增强方面均有明显提升。
工作原理
PiD将Latent解码器重新定义为像素空间中的扩散过程:
- 首先通过轻量级编码器将Latent表示投影为低分辨率像素图像
- 条件扩散模型在Latent特征的引导下对此低分辨率图像进行去噪
- 结果是在一次传递中获得高分辨率、细节丰富的图像——将解码和上采样结合在一起
这种方法意味着PiD可以直接从标准Latent表示生成最高4K分辨率的图像,而无需单独的图像放大步骤。
即用型工作流
ComfyUI 工作流库中提供了两个官方模板,展示 PiD 的实际应用:
PiD Latent Upscale — 将 PiD 作为 FLUX、FLUX.2 和 PixelDiT 主干网络的 latent upscale/解码器替代方案。
PixelDiT 文生图 — 使用 PixelDiT 作为骨干网络、PiD 进行解码的完整文生图流水线。
与ComfyUI的相关性
PiD 可通过自定义节点(ComfyUI-PiD)在 ComfyUI 中使用,并已集成到官方模板工作流中。PiD Latent Upscale 工作流允许将 PiD 作为 FLUX、FLUX.2 和 PixelDiT 的即插即用 VAE 解码器替代方案,而 PixelDiT 文生图工作流则展示了端到端生成与 PiD 解码的结合。
该模型根据NSCLv1许可证发布(仅限非商业研究或评估)。


评论
使用 GitHub 登录后即可参与讨论。