Qwen-Image 2.1 Fun Acc LoRA: официальная 4-шаговая дистилляция

ComfyUI Wikinews

Alibaba PAI дистиллирует Qwen-Image 2.1 до 4 шагов с помощью LoRA PDD размером 346 МБ, охватывающей text-to-image и редактирование по инструкции, с собственным расписанием сигм.

Qwen-Image-2.1-Fun-Acc-LoRAs (Hugging Face | VideoX-Fun) это 4-шаговый адаптер ускорения от Alibaba PAI для Qwen-Image 2.1. Одна LoRA размером 346 МБ снижает text-to-image и редактирование по инструкции до 4 NFE с помощью Parallel Decoding Distillation, а репозиторий также содержит код сэмплера и точное расписание сигм, под которое она дистиллировалась.

Адаптер следует тому же рецепту, который Alibaba PAI использовала для MiniMax H3 PDD Acc LoRAs в августе: взять сильную базовую модель, дистиллировать её с помощью Parallel Decoding Distillation (PDD, arXiv 2607.26004) и выпустить извлечённую LoRA вместе с кодом вывода, необходимым для воспроизведения эталонных результатов. Сама Qwen-Image 2.1 вышла 20 сентября 2026 года и уже поддерживается в ComfyUI, так что это вариант ускорения модели, которой всего несколько дней.

Что входит в репозиторий

Адаптерmodels/Qwen-Image-2.1-Fun-Acc-4Step.safetensors, 346 МБ, ранг 64 и network_alpha 64 в BF16
Базовая модельQwen-Image 2.1 (Qwen/Qwen-Image-2.1), веса без изменений
Шаги4 NFE (pdd_num_steps: 4, pdd_block_size: 1)
ЗадачиText-to-image и редактирование изображений по инструкции
Обученные целиimg_in, modulation.1, norm_out.linear, эмбеддеры временных шагов, attn.to_q/to_k/to_v/to_out.0 и img_mlp всех 32 блоков трансформера, а также txt_in.in_layer / txt_in.out_layer
Дополнительно только для выводаВнимание norm_q / norm_k и txt_in.text_norm хранятся как полные параметры, а не как LoRA-пары
Размер образца по умолчанию2048 x 2048 (pdd_sample_size)
Точность выборкиnative_time_fp32_state

Расписание сигм является частью релиза, а не деталью реализации: pdd_config.json фиксирует четырёхшаговое расписание как 1.0, 0.9169867, 0.7861579, 0.549491, 0.0, а экспортируемый формат: qwenimage21_extracted_prefused_v1. Именно из-за этих чисел это не обычная LoRA, которую можно просто подставить. Обычный 4-шаговый сэмплер с сигмами по умолчанию не воспроизводит дистиллированное поведение.

Как это сравнивается

В карточке модели опубликованы трёхсторонние сравнения для каждого примера: учитель при 40 NFE, PDD LoRA при 4 NFE и Viggle v0.1 full при 4 NFE. PDD сравнивается не только со своим учителем, но и с другим 4-шаговым путём для этой модели: turbo LoRA Viggle, выпущенной ранее в сентябре.

Выход учителя при 40 NFEВыход PDD LoRA при 4 NFEViggle v0.1 при 4 NFE
Учитель: 40 NFEPDD LoRA: 4 NFEViggle v0.1 full: 4 NFE

Пример text-to-image, промпт взят из статьи о PDD. Во всех трёх панелях используется seed 42.

Редактирование охватывается тем же адаптером, включая правки с несколькими референсами. В примере ниже флаг на референсном изображении перерисовывается, а третий столбец показывает тот же 4-шаговый путь, обслуживаемый turbo LoRA Viggle.

Референс для правкиПравка учителяПравка PDD LoRAПравка Viggle v0.1
Референсное изображениеУчитель: 40 NFEPDD LoRA: 4 NFEViggle v0.1 full: 4 NFE
Правка учителя с двумя референсамиПравка PDD LoRA с двумя референсамиПравка Viggle v0.1 с двумя референсами
Учитель: 40 NFEPDD LoRA: 4 NFEViggle v0.1 full: 4 NFE

Пример правки с двумя референсами (человек и кот), seed 43.

Задокументированные ограничения

В карточке модели перечислены два известных отставания от учителя, а не оставлены на самостоятельное обнаружение:

  • Плотный мелкий текст может заметно деградировать: искажаются штрихи символов и снижается разборчивость.
  • Некоторые результаты редактирования выглядят немного более размытыми и тёмными, чем у учителя, со сниженной чёткостью мелких деталей.

Доступность

Официальной поддержки ComfyUI нет, и релиз написан для официального pipeline:

  • Только Diffusers: держите поставляемые qwenimage21_pdd.py и lora_utils_pdd.py рядом со скриптами и запускайте python predict_t2i.py (генерация) или python predict_t2i_edit.py (редактирование).
  • VideoX-Fun: используйте checkout, в котором QwenImage21Pipeline доступен из videox_fun.pipeline, и запускайте predict_t2i_videox_fun.py или predict_t2i_edit_videox_fun.py.

Для ComfyUI пока есть только экспериментальный путь: Kijai опубликовал ветку Qwen-Image 2.1 PDD репозитория ComfyUI, и LoRA нуждается в конвертации, прежде чем загрузчик ComfyUI сможет её использовать. Поскольку расписание и не-LoRA параметры norm_q / norm_k / text_norm являются частью дистилляции, относитесь к конвертациям этого адаптера для ComfyUI как к работе сообщества, а не как к поддерживаемому пути.

Более ранние адаптеры ускорения той же команды для MiniMax H3 служат ближайшей точкой отсчёта для того, как работает это семейство релизов: там тоже дистиллированная LoRA поставлялась с собственным рецептом вывода, а не как обычная LoRA для базовой модели.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Qwen-Image 2.1 Fun Acc LoRA: официальная 4-шаговая дистилляция | ComfyUI Wiki