Turbo8: дистилляционная LoRA на 8 шагов для Qwen-Image 2.1

ComfyUI Wikinews

Turbo8 дистиллирует Qwen-Image 2.1 до 8 шагов без CFG: text-to-image, редактирование, вывод RGBA и извлечение объекта, плюс два готовых рабочих процесса ComfyUI.

Turbo8 (Hugging Face) представляет собой LoRA пошаговой дистилляции для Qwen-Image 2.1, которая выполняет рендеринг за 8 шагов при CFG 1, примерно пятую часть от 40 проходов базовой модели. Один файл размером 1.36 GB охватывает text-to-image, рендеринг текста, редактирование по инструкции с использованием до 10 референсных изображений, генерацию с прозрачностью (RGBA) и извлечение объекта, а репозиторий содержит два готовых рабочих процесса ComfyUI.

С момента выпуска 20 сентября 2026 года Qwen-Image 2.1 обзавёлся несколькими маршрутами с малым числом шагов: LoRA Pruna на 5 и 8 шагов, turbo LoRA от Viggle и официальная 4-шаговая дистилляция Fun Acc от Alibaba PAI. Turbo8: вклад сообщества в этой же гонке, и его отличительная черта: широта охвата. Вместо ускорения только text-to-image он обучен сохранять поведение всей базовой модели, включая пути редактирования с RGBA и несколькими референсами, с которыми более ранние адаптеры справлялись хуже.

Сгенерированные примеры с Turbo8 при 8 шагах и CFG 1

Все примеры используют Turbo8 с 8 шагами и CFG 1 при 1024², первый seed, без отбора лучших результатов внутри промпта. Промпты для показа выбраны из отложенного оценочного набора. Источник: Turbo8-LoRA-Qwen-Image-2.1.

Что он делает

Адаптер представляет собой LoRA ранга 128 на слоях внимания, MLP, модуляции и timestep-embedding модели Qwen-Image 2.1, дистиллированную так, что базовые веса остаются нетронутыми. При выводе он работает с 8 шагами, CFG 1, сэмплером euler, scheduler simple, и автор отмечает, что превышение 8 шагов или CFG 1 не улучшает результаты.

Заявленное преимущество: не одна задача, а широта охвата: text-to-image вплоть до нативного разрешения модели 2K, рендеринг английского и китайского текста, редактирование по инструкции с использованием до 10 референсных изображений, генерация с прозрачностью и извлечение объекта (передаёте фото и запрашиваете RGBA-вырезку). Карточка модели также документирует путь обучения: это трёхэтапный рецепт: 3 100 рендеров учителя за 40 шагов с фиксированным шумом, записанных на 8 уровнях шума ученика, 3 000 шагов регрессии траектории, затем 2 500 шагов сопоставления распределений DMD2 с критиком на основе fake-score и GAN-головой. Критик представляет собой вторую LoRA на том же замороженном transformer.

Запуск в ComfyUI

Turbo8 рассчитан непосредственно на нативную поддержку Qwen-Image 2.1 в ComfyUI:

  1. Поместите turbo8_lora_step2500.safetensors в ComfyUI/models/loras/.
  2. Загрузите comfyui/turbo8_t2i.json (text-to-image и RGBA) или comfyui/turbo8_edit.json (редактирование и извлечение).
  3. Оставьте 8 шагов, CFG 1, сэмплер euler, scheduler simple.

Граф T2I включает ноду ModelSamplingFlux (max_shift 0.6935, base_shift 0.5), подключённую к ширине и высоте, что воспроизводит зависящее от разрешения расписание шума, с которым дистиллировалась LoRA, в том числе при 2K. Согласно карточке модели, все 227 слоёв LoRA корректно отображаются в ComfyUI, а изображение 1024² занимает около 4 секунд на RTX PRO 6000.

Сравнение с учителем

В карточке модели Turbo8 сравнивается со своим учителем, базовой моделью на 40 шагах, на 192 отложенных промптах: DrawBench плюс дополнительные seed, промпты на рендеринг текста, RGBA-объекты, правки и извлечения OmniEdit.

МетрикаУчитель (40 шагов)Turbo8 (8 шагов)
PickScore, T2I22.1521.94
CLIPScore, T2I26.8926.89
PickScore, RGBA20.5120.07
Точное совпадение текста (OCR)95.0%75.0%
Посимвольная точность текста99.6%95.3%
Доля прозрачности (RGBA + извлечение)0.8750.925
Разнообразие seed (меньше значит разнообразнее)0.7050.670
Сходство правок с учителем (DINOv2)н/д0.967
IoU альфы извлечения относительно учителян/д0.85
Учитель на 40 шагах против Turbo8 на 8 шагах, одинаковый seed

Учитель на 40 шагах (верхний ряд в каждой паре) против Turbo8 на 8 шагах (нижний ряд), одинаковый seed. Примеры охватывают text-to-image, рендеринг текста, правки, RGBA и извлечение.

Задокументированные ограничения

В карточке модели перечислены слабые места, а не оставлены на самостоятельный поиск:

  • Плотный или длинный текст (абзацы, мелкий шрифт) деградирует гораздо сильнее, чем при 40 шагах, тогда как короткие заголовки, вывески и подписи остаются надёжными.
  • На некоторых насыщенных сценах композиция может отличаться от той, что даёт учитель при том же seed.
  • Извлечение наследует неудачные случаи базовой модели: в оценке 3 из 16 извлечений оказались пустыми как у учителя, так и у Turbo8, а Turbo8 иногда сохраняет больше окружающего контекста в вырезке.

В сообществе

В канале #qwen-image сообщества Banodoco пользователи в последующие дни тестировали Turbo8 против более ранних маршрутов с малым числом шагов. Общий вывод: для устойчивой работы при редактировании ему нужны сниженная strength и более 8 шагов: в сообщениях сходились на strength 0.65 и примерно 16 шагах до появления артефактов на теле, и несколько пользователей поставили его выше 6-шагового turbo от Viggle для правок, продолжая при этом предпочитать 8-шаговое расписание Pruna для части задач.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Turbo8: дистилляционная LoRA на 8 шагов для Qwen-Image 2.1 | ComfyUI Wiki