Nvidia PiD v1.5: диффузионный декодер для FLUX.2 и Qwen-Image
Nvidia выпускает PiD v1.5 с улучшенным качеством декодирования для FLUX, FLUX.2 и Qwen-Image: более точная цветопередача, меньше артефактов и повышенная детализация.
2kto4k_v1pt5 для декодирования вплоть до 4K.
Что такое PiD?
PiD (Pixel Diffusion Decoder) переосмысливает декодер латентного представления в пиксельное как условную диффузионную модель в пиксельном пространстве, объединяя декодирование и повышение разрешения в единый генеративный модуль. Вместо стандартного VAE-декодера, который просто инвертирует кодировщик, PiD напрямую убирает шум в пиксельном пространстве высокого разрешения и получает изображение с повышенным разрешением за один проход.
Стандартный VAE-декодер, используемый в латентных диффузионных моделях (FLUX, SD3, SDXL), ориентирован на реконструкцию — он оптимизирован для инвертирования кодировщика, а не для синтеза дополнительных деталей. PiD заменяет его генеративным подходом, который может создавать более резкие и детализированные результаты при более высоком разрешении, сохраняя согласованность со сгенерированными латентными представлениями.
Что нового в v1.5
PiD v1.5 приносит целевые улучшения в трех основных латентных пространствах:
- Улучшенная цветопередача при декодировании — более точная цветопередача из сгенерированных латентных представлений
- Устранены сетчатые артефакты по краям изображения — более чистые результаты, особенно при высоком разрешении
- Улучшенная детализация аниме и лиц — лучшее воспроизведение тонких структурных элементов
Новая контрольная точка 2kto4k_v1pt5 является рекомендуемым декодером до 4K для FLUX, FLUX.2 и Qwen-Image. Предыдущие контрольные точки 2kto4k для этих моделей объявлены устаревшими и перемещены в checkpoints_deprecated/.
Доступные контрольные точки
Все контрольные точки PiD дистиллированы в 4 шага:
| Базовая модель | Разрешение 2K | Разрешение от 2K до 4K |
|---|---|---|
| FLUX | PiD_res2k_sr4x_flux_distill_4step | PiD_v1pt5_res2kto4k_sr4x_flux_distill_4step |
| FLUX.2 | PiD_res2k_sr4x_flux2_distill_4step | PiD_v1pt5_res2kto4k_sr4x_flux2_distill_4step |
| Qwen-Image | — | PiD_v1pt5_res2kto4k_sr4x_qwenimage_distill_4step |
Контрольные точки v1.5 2kto4k также поддерживают варианты Z-Image, Z-Image-Turbo и FLUX.2-Klein (4B/9B).
![]() | ![]() |
|---|---|
| Стандартный VAE (512×512) | PiD v1.5 (2048×2048) |
Сравнение: латентные представления FLUX.2, декодированные стандартным VAE и PiD v1.5 — более точная цветопередача, меньше артефактов, повышенная детализация.
Как это работает
PiD переосмысливает латентный декодер как диффузионный процесс в пиксельном пространстве:
- Латентное представление сначала проецируется на низкоразмерное пиксельное изображение с помощью легковесного кодировщика
- Условная диффузионная модель убирает шум с этого низкоразмерного изображения, руководствуясь латентными признаками
- В результате за один проход получается изображение с высоким разрешением и богатое деталями, что объединяет декодирование и повышение разрешения
Такой подход позволяет PiD генерировать изображения разрешением до 4K непосредственно из стандартных латентных представлений без необходимости отдельного шага увеличения разрешения.
Готовые рабочие процессы
Два официальных шаблона из библиотеки рабочих процессов ComfyUI демонстрируют PiD в действии:
PiD Latent Upscale — применение PiD в качестве замены латентного upscale/декодера для FLUX, FLUX.2 и PixelDiT.
PixelDiT Text-to-Image — полный конвейер генерации текста в изображение с PixelDiT в качестве основы и PiD для декодирования.
Актуальность для ComfyUI
PiD доступен в ComfyUI через пользовательские узлы (ComfyUI-PiD) и уже интегрирован в официальные шаблоны рабочих процессов. PiD Latent Upscale позволяет использовать PiD в качестве прямой замены VAE-декодера для FLUX, FLUX.2 и PixelDiT, а PixelDiT Text-to-Image демонстрирует сквозную генерацию с декодированием PiD.
Модель распространяется по лицензии NSCLv1 (только некоммерческое исследование или оценка).


Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.