Nvidia PiD v1.5: FLUX.2 및 Qwen-Image용 Pixel Diffusion Decoder

news

Nvidia Research에서 PiD v1.5를 출시했습니다. FLUX, FLUX.2, Qwen-Image의 디코딩 품질이 개선되어 더 나은 색상, 적은 아티팩트, 향상된 디테일을 제공합니다.

Nvidia ResearchPiD v1.5(Pixel Diffusion Decoder)는 FLUX, FLUX.2, Qwen-Image용으로 업데이트된 체크포인트를 제공합니다. 색상 충실도가 개선되고, 그리드 아티팩트가 제거되었으며, 애니메이션 및 얼굴 디테일이 향상되었습니다. 또한 이 업데이트는 최대 4K 디코딩을 위한 새로운 권장 2kto4k_v1pt5 체크포인트 변형을 도입합니다.
PiD teaser - VAE vs PiD 디코딩 비교

PiD란 무엇인가?

PiD(Pixel Diffusion Decoder)는 잠재-픽셀 디코더를 조건부 픽셀 공간 확산 모델로 재구성하여 디코딩과 업스케일링을 단일 생성 모듈로 통합합니다. 표준 VAE 디코더가 단순히 인코더를 반전시키는 것과 달리, PiD는 고해상도 픽셀 공간에서 직접 잡음을 제거하고 한 번에 초해상도 이미지를 생성합니다.

잠재 확산 모델(FLUX, SD3, SDXL)에서 사용되는 표준 VAE 디코더는 재구성 중심으로, 추가 디테일을 합성하기보다 인코더를 반전시키도록 최적화되어 있습니다. PiD는 이를 생성적 접근 방식으로 대체하여 생성된 잠재 데이터와의 일관성을 유지하면서 더 높은 해상도에서 더 선명하고 디테일이 풍부한 출력을 생성할 수 있습니다.

v1.5의 새로운 기능

PiD v1.5는 세 가지 주요 잠재 공간에 걸쳐 다음과 같은 개선 사항을 제공합니다.

  • 디코딩 색상 충실도 개선 — 생성된 잠재 데이터에서 더 정확한 색상 재현
  • 이미지 모서리의 그리드 아티팩트 제거 — 특히 고해상도에서 더 깔끔한 출력
  • 애니메이션 및 얼굴 디테일 개선 — 미세 구조 요소의 더 나은 처리

새로운 2kto4k_v1pt5 체크포인트는 FLUX, FLUX.2, Qwen-Image용 권장 최대 4K 디코더입니다. 이 모델들의 이전 2kto4k 체크포인트는 지원 중단되었으며 checkpoints_deprecated/로 이동되었습니다.

사용 가능한 체크포인트

모든 PiD 체크포인트는 4-step distilled입니다.

백본2k 해상도2k-to-4k 해상도
FLUXPiD_res2k_sr4x_flux_distill_4stepPiD_v1pt5_res2kto4k_sr4x_flux_distill_4step
FLUX.2PiD_res2k_sr4x_flux2_distill_4stepPiD_v1pt5_res2kto4k_sr4x_flux2_distill_4step
Qwen-ImagePiD_v1pt5_res2kto4k_sr4x_qwenimage_distill_4step

v1.5 2kto4k 체크포인트는 또한 Z-Image, Z-Image-Turbo, FLUX.2-Klein (4B/9B) 변형을 지원합니다.

표준 VAE 디코딩PiD v1.5 디코딩
표준 VAE (512×512)PiD v1.5 (2048×2048)

비교: FLUX.2 잠재 표현을 표준 VAE 디코더와 PiD v1.5로 디코딩한 결과 — PiD에서 색상 재현력, 아티팩트 감소, 디테일 향상이 뚜렷하게 개선됨.

작동 방식

PiD는 픽셀 공간에서의 확산 과정으로 잠재 디코더를 재구성합니다.

  1. 잠재 표현은 먼저 경량 인코더를 통해 저해상도 픽셀 이미지로 투영됩니다.
  2. 조건부 확산 모델이 잠재 특징의 안내에 따라 이 저해상도 이미지의 잡음을 제거합니다.
  3. 결과는 디코딩과 업스케일링을 결합한 단일 패스의 고해상도, 디테일이 풍부한 이미지입니다.

이 접근 방식은 PiD가 별도의 업스케일링 단계 없이 표준 잠재 표현에서 직접 최대 4K 해상도의 이미지를 생성할 수 있음을 의미합니다.

바로 사용 가능한 워크플로

ComfyUI 워크플로 라이브러리의 두 가지 공식 템플릿이 PiD의 실제 활용을 보여줍니다.

PiD Latent Upscale — FLUX, FLUX.2, PixelDiT 백본에 PiD를 잠재 업스케일/디코더 대체로 적용.

PixelDiT Text-to-Image — PixelDiT를 백본으로, PiD를 디코딩에 사용하는 종단간 텍스트-투-이미지 파이프라인.

ComfyUI 관련성

PiD는 커스텀 노드(ComfyUI-PiD)를 통해 ComfyUI에서 사용할 수 있으며, 이미 공식 템플릿 워크플로에 통합되었습니다. PiD Latent Upscale 워크플로를 사용하면 FLUX, FLUX.2, PixelDiT에서 PiD를 드롭인 VAE 디코더 대체품으로 사용할 수 있으며, PixelDiT Text-to-Image 워크플로는 PiD 디코딩을 통한 종단간 생성을 보여줍니다.

이 모델은 NSCLv1 라이선스(비상업적 연구 또는 평가 전용) 하에 출시되었습니다.

Nvidia PiD on HF Paper on arXiv Project Page

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Nvidia PiD v1.5: FLUX.2 및 Qwen-Image용 Pixel Diffusion Decoder | ComfyUI Wiki