Nvidia PiD v1.5: диффузионный декодер для FLUX.2 и Qwen-Image

news

Nvidia выпускает PiD v1.5 с улучшенным качеством декодирования для FLUX, FLUX.2 и Qwen-Image: более точная цветопередача, меньше артефактов и повышенная детализация.

PiD v1.5 (Pixel Diffusion Decoder) от Nvidia Research предлагает обновленные контрольные точки для FLUX, FLUX.2 и Qwen-Image с улучшенной цветопередачей, отсутствием сетчатых артефактов и повышенной детализацией аниме и лиц. Обновление также включает новый рекомендуемый вариант контрольной точки 2kto4k_v1pt5 для декодирования вплоть до 4K.
PiD teaser - сравнение VAE и PiD

Что такое PiD?

PiD (Pixel Diffusion Decoder) переосмысливает декодер латентного представления в пиксельное как условную диффузионную модель в пиксельном пространстве, объединяя декодирование и повышение разрешения в единый генеративный модуль. Вместо стандартного VAE-декодера, который просто инвертирует кодировщик, PiD напрямую убирает шум в пиксельном пространстве высокого разрешения и получает изображение с повышенным разрешением за один проход.

Стандартный VAE-декодер, используемый в латентных диффузионных моделях (FLUX, SD3, SDXL), ориентирован на реконструкцию — он оптимизирован для инвертирования кодировщика, а не для синтеза дополнительных деталей. PiD заменяет его генеративным подходом, который может создавать более резкие и детализированные результаты при более высоком разрешении, сохраняя согласованность со сгенерированными латентными представлениями.

Что нового в v1.5

PiD v1.5 приносит целевые улучшения в трех основных латентных пространствах:

  • Улучшенная цветопередача при декодировании — более точная цветопередача из сгенерированных латентных представлений
  • Устранены сетчатые артефакты по краям изображения — более чистые результаты, особенно при высоком разрешении
  • Улучшенная детализация аниме и лиц — лучшее воспроизведение тонких структурных элементов

Новая контрольная точка 2kto4k_v1pt5 является рекомендуемым декодером до 4K для FLUX, FLUX.2 и Qwen-Image. Предыдущие контрольные точки 2kto4k для этих моделей объявлены устаревшими и перемещены в checkpoints_deprecated/.

Доступные контрольные точки

Все контрольные точки PiD дистиллированы в 4 шага:

Базовая модельРазрешение 2KРазрешение от 2K до 4K
FLUXPiD_res2k_sr4x_flux_distill_4stepPiD_v1pt5_res2kto4k_sr4x_flux_distill_4step
FLUX.2PiD_res2k_sr4x_flux2_distill_4stepPiD_v1pt5_res2kto4k_sr4x_flux2_distill_4step
Qwen-ImagePiD_v1pt5_res2kto4k_sr4x_qwenimage_distill_4step

Контрольные точки v1.5 2kto4k также поддерживают варианты Z-Image, Z-Image-Turbo и FLUX.2-Klein (4B/9B).

Стандартный VAE декодерPiD v1.5 декодер
Стандартный VAE (512×512)PiD v1.5 (2048×2048)

Сравнение: латентные представления FLUX.2, декодированные стандартным VAE и PiD v1.5 — более точная цветопередача, меньше артефактов, повышенная детализация.

Как это работает

PiD переосмысливает латентный декодер как диффузионный процесс в пиксельном пространстве:

  1. Латентное представление сначала проецируется на низкоразмерное пиксельное изображение с помощью легковесного кодировщика
  2. Условная диффузионная модель убирает шум с этого низкоразмерного изображения, руководствуясь латентными признаками
  3. В результате за один проход получается изображение с высоким разрешением и богатое деталями, что объединяет декодирование и повышение разрешения

Такой подход позволяет PiD генерировать изображения разрешением до 4K непосредственно из стандартных латентных представлений без необходимости отдельного шага увеличения разрешения.

Готовые рабочие процессы

Два официальных шаблона из библиотеки рабочих процессов ComfyUI демонстрируют PiD в действии:

PiD Latent Upscale — применение PiD в качестве замены латентного upscale/декодера для FLUX, FLUX.2 и PixelDiT.

PixelDiT Text-to-Image — полный конвейер генерации текста в изображение с PixelDiT в качестве основы и PiD для декодирования.

Актуальность для ComfyUI

PiD доступен в ComfyUI через пользовательские узлы (ComfyUI-PiD) и уже интегрирован в официальные шаблоны рабочих процессов. PiD Latent Upscale позволяет использовать PiD в качестве прямой замены VAE-декодера для FLUX, FLUX.2 и PixelDiT, а PixelDiT Text-to-Image демонстрирует сквозную генерацию с декодированием PiD.

Модель распространяется по лицензии NSCLv1 (только некоммерческое исследование или оценка).

Nvidia PiD на HF Статья на arXiv Страница проекта

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Nvidia PiD v1.5: диффузионный декодер для FLUX.2 и Qwen-Image | ComfyUI Wiki