Fizgig v6.5: LoRA для Qwen Image 2.1 со своим адаптером

ComfyUI Wikinews

Fizgig v6.5 добавляет обучение LoRA и LoKR для Qwen Image 2.1 со своим адаптером, turbo-превью и новой системой драйверов. LoRA загружаются в ComfyUI.

Fizgig v6.5.0, выпущенный 27 сентября, делает Qwen Image 2.1 обучаемой базовой моделью внутри студии (GitHub | примечания к выпуску | руководство по Qwen Image 2.1). Fizgig уже обучает LoRA, LoKR и полные fine-tune для Flux 2 Klein, Krea 2 и MiniMax H3. Этот выпуск приносит тот же набор инструментов для image-модели Qwen, и Qwen Image 2.1 становится первой моделью, добавленной через новую систему драйверов студии.

Студия LoRA и fine-tune Fizgig

Fizgig: рабочая среда для обучения, fine-tune, восстановления и исследования для Flux 2 Klein 9B, Krea 2, MiniMax H3 и теперь Qwen Image 2.1

Что включает обучение Qwen Image 2.1

  • Обучение LoRA или LoKR с Adaptive LR или Automagic, EMA, Context LoRA, а также паузой и возобновлением.
  • Turbo-превью во время обучения, работающие на 6-шаговом turbo LoRA от Viggle. По умолчанию Fizgig запускает его ниже полной силы, на 0.7 в течение 10 шагов, после того как в собственных тестах выяснил, что это превосходит стандартные 6 шагов turbo на полной силе.
  • Контроль loss по каждому изображению: детекция проблемных изображений, индивидуальные learning rate для изображений, разогрев look-outlier и автоматическое повторное подписывание застрявших изображений с помощью того же Qwen3-VL captioner, что используется на вкладке Captions.
  • Панель переопределения live-сэмплов прямо во время запуска.
  • Все пять инструментов рабочей среды: Repair Studio, LoRA the Explorer, Profiler, Extract и LoRA Royale.

Сохранённые LoRA, LoKR, сохранения Repair Studio и выходы Extract загружаются через стандартный загрузчик LoRA в ComfyUI.

Собственный обучающий адаптер Fizgig

LoRA для Qwen 2.1 имеют привычку схлопываться в текстуру или "плыть" в середине запуска, и более низкий loss не предупредит вас об этом. Решение Fizgig: обучающий адаптер, небольшой LoRA, который остаётся замороженным и активным во время обучения, отключается для превью и никогда не попадает в сохранённый LoRA, так что результат работает на обычной модели. Он был обучен при более высоком разрешении, чем существующий обучающий ассистент Qwen 2.1, и автор сообщает, что LoRA, обученные с ним, получаются намного более резкими и при этом не схлопываются. Он включён по умолчанию в каждом пресете Qwen и также опубликован для любого тренера на Hugging Face.

Три пресета, одна золотая середина

Все три пресета обучаются при 0.5 MP с adamw8bit, EMA 0.98 и обучающим адаптером, в течение 30 эпох, сохраняя каждую эпоху:

ПресетRankLearning rateДля
Qwen 2.1 Fast (по умолчанию)8Adaptive LR от 2e-4 до 4e-4Большинство субъектов. Быстрее всех достигает сходства в тестах автора и лучше всех сохраняет детали кожи.
Qwen 2.1 Standard16Adaptive LR от 1e-4 до 2e-4Большие или смешанные датасеты. Rank 16 на скоростях пресета Fast приводит к переобучению.
Qwen 2.1 Style16Фиксированный 1.5e-4Стили. Adaptive LR склонен расти на датасетах стилей, и именно там стили перепекаются.

Причина более быстрого обучения: Qwen выдаёт очень резкие изображения из коробки, а LoRA тянет мелкие детали, например текстуру кожи, к тому, что есть в вашем датасете, поэтому длинный прогон на более мягких фото обменивает резкость Qwen на их резкость. 0.5 MP это полмиллиона пикселей, около 704×704 для квадратного изображения, и Fizgig группирует каждое изображение по форме при таком количестве пикселей: 624×784 при 4:5, 576×848 при 2:3 и 528×928 при 9:16. Сохранённые эпохи остаются доступными для перебора в LoRA Royale, так что если более поздняя эпоха выглядит мягче, более ранняя часто оказывается лучшим выбором.

Видеокарты вплоть до 10 GB

Базовая точность и размер block swap подбираются автоматически исходя из вашей свободной VRAM. Авто выбирает bf16 при 24 GB и выше, INT8 от 12 до 16 GB и 4-битный NF4 при 10 GB, что является минимальным порогом для Qwen Image 2.1; text encoder квантуется до 8 бит при менее чем примерно 20 GB свободной памяти, и именно это задаёт этот порог. В тестах автора RTX 5090, ограниченная 12 GB, обучалась на INT8 с пиком 9.9 GB, включая превью, а ограниченная 10 GB обучалась на NF4 с пиком 7.3 GB.

Система драйверов

Qwen Image 2.1 первая модель, добавленная через новую систему драйверов Fizgig: модель описывается один раз, как её файлы, формат LoRA и её код модели за стандартным интерфейсом, и от этого описания работают обучение, превью, загрузки, планирование памяти и все пять инструментов рабочей среды. Руководство по системе и открытые pull request'ы для добавления новых моделей обещаны на следующей неделе.

Как получить

Нажмите Download models for me в разделе Qwen Image 2.1 на вкладке Preferences, чтобы загрузить DiT, VAE, text encoder, обучающий адаптер и turbo LoRA (около 34 GB), а также Qwen3-VL captioner, если у вас его нет, затем выберите Qwen Image 2.1 как Base Model на вкладке Training. Редактирование обучения для Qwen Image 2.1 указано как "Скоро будет".

Fizgig это отдельный тренер, а не нода ComfyUI: он сохраняет LoRA в формате kohya .safetensors, которые сразу попадают в ComfyUI/models/loras/.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Fizgig v6.5: LoRA для Qwen Image 2.1 со своим адаптером | ComfyUI Wiki