Qwen-Image-2.1-Turbo: официальный 8-шаговый Turbo-чекпойнт в ComfyUI
Официальный чекпойнт Qwen-Image-2.1-Turbo от Alibaba выполняет 7B-генератор и редактор за 8 шагов denoising при CFG 1, а Comfy-Org переупаковала веса для ComfyUI.
Позы и движение человека: одна из категорий 8-шаговой генерации в собственном шоукейсе Turbo от Alibaba.
Что меняет Turbo-чекпойнт
Turbo это не новая архитектура. Это второй чекпойнт Qwen-Image 2.1 со встроенным расписанием выборки, поэтому те же веса трансформера по-прежнему обслуживают генерацию, редактирование по инструкции, RGBA-прозрачность и извлечение субъекта. Различия, которые важны при настройке:
- 8 шагов denoising вместо 40. Рекомендуемое расписание из 8 шагов поставляется внутри чекпойнта. В карточке модели прямо указано, что передача одного лишь
num_inference_stepsего не переопределяет и что другие расписания для этого чекпойнта не оценивались. - CFG 1 по умолчанию. Classifier-free guidance отключён, поэтому каждый шаг выполняется за один прямой проход.
- Кэширование Prefix KV переиспользует контекст текста и референсных изображений между шагами denoising, что pipeline включает с помощью
use_kv_cache=True. - Те же пресеты разрешения, что и у базовой модели, от 2048x2048 (1:1) до 2752x1536 (16:9) и соответствующие портретные пропорции.
- Пока что на основе diffusers. Он загружается через
QwenImage21Pipelineи требует сборки diffusers, поддерживающей сигмы выборки, настроенные в pipeline.
Сохранённое расписание: 1.0, 0.978453, 0.95418, 0.926626, 0.89508, 0.845148, 0.704534, 0.414568, оно заканчивается пустым шагом 0. В канале #qwen-image в Banodoco Kijai отметил, что оно близко к шедулеру ComfyUI linear_quadratic без применения shift, и что в целом он не видел, чтобы фиксированное расписание Euler обыгрывало стохастический сэмплер на turbo-чекпойнтах.
Примеры
В карточке модели её 8-шаговые выходы сгруппированы по тому, что люди на самом деле просят модель сделать. Портретная фотография и типографика для постеров получаются из того же чекпойнта, что и примеры редактирования:
Портрет, сгенерированный за 8 шагов при 1680x2512.
Типографика и дизайн постеров: категория, которая раньше требовала полного прогона из 40 шагов.
UI и информационная вёрстка: один из более сложных случаев структурированного вывода.
Прозрачность сохраняется и при ускорении: альфа-канал записывается моделью, поэтому стикеры и продуктовые ассеты по-прежнему получаются готовыми к композитингу.
Генерация прозрачных изображений с Turbo-чекпойнтом.
Редактирование работает так же, как у базовой модели, включая преобразование одного изображения:
![]() | ![]() |
|---|---|
| Вход: референс | Выход редактирования за 8 шагов (2048x2048) |
Доступность в ComfyUI
В Comfy-Org/Qwen-Image-2.1 Turbo добавили в течение нескольких часов после релиза, в тех же трёх формах, что и базовую модель:
diffusion_models/qwen_image_2.1_turbo_bf16.safetensors, полный 8-шаговый чекпойнт в BF16.diffusion_models/qwen_image_2.1_turbo_int8_convrot.safetensors, квантизация INT8 convrot для меньшего объёма VRAM.loras/qwen_image_2.1_turbo_lora_avg_rank_178_bf16.safetensors, LoRA-извлечение той же дистилляции, которое вы загружаете поверх базового трансформера вместо замены чекпойнтов.
Текстовый энкодер и VAE общие с Qwen-Image 2.1, поэтому конфигурации, которая уже запускает базовую модель, нужен только новый трансформер или LoRA. Веса Turbo встраиваются в существующий официальный рабочий процесс Qwen-Image 2.1: установите сэмплер на 8 шагов и CFG 1 и выберите либо turbo-диффузионную модель, либо базовую модель вместе с turbo LoRA.
Первые отзывы
Релиз появился в #qwen-image в тот же день и был протестирован на месте. RuneX сообщил, что «официальный turbo работает отлично» и что на том же промпте он выглядел заметно лучше, чем как минимум один сторонний Turbo LoRA. Corza сравнил поставляемые сигмы с пользовательским расписанием Euler и нашёл разницу незначительной: в основном немного дополнительной резкости и детализации кожи, когда сверху накладываются LoRA или LoKR, что совпадает с проблемой избыточного сглаживания, о которой сообщали для стекированных адаптеров на базовой модели. Kijai не впечатлил узел из сообщества, обещавший лучшие результаты с turbo: он отметил, что на flow-matching моделях сэмплер Euler в ComfyUI уже является flow-match Euler, поэтому такие узлы в основном меняют сигмы.


Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.