Fizgig v5 Полное дообучение: Обучение MiniMax H3 и Krea 2 на 16 ГБ
Fizgig v5.0.0 добавляет полное дообучение базовых моделей MiniMax H3 33B и Krea 2 12.9B на потребительских GPU от 16 ГБ VRAM, с экспортом чекпойнта в LoRA.
Fizgig v5.0.0, выпущенный 29 августа, добавляет полное дообучение базовых моделей MiniMax H3 (33B) и Krea 2 (12.9B) на одной потребительской видеокарте, начиная с 16 ГБ VRAM (GitHub | release notes, Apache-2.0). До этого каждый запуск Fizgig обучал адаптер LoRA на замороженной модели. Это обновление обучает саму модель: полноранговые обновления весов без адаптера и без ограничений по рангу, используя вращающееся обучающее окно поверх 4-битной NF4 замороженной базы, при этом мастер-копия bf16 хранится в системной оперативной памяти.
Fizgig: рабочая среда для обучения, дообучения, ремонта и исследования MiniMax H3, Krea 2 и Flux 2 Klein 9B
Что ваша карточка может дообучить
| VRAM | Krea 2 фото | H3 фото | H3 голос | H3 видео (Подтверждено) | H3 видео на блоках сходства (Ожидается) |
|---|---|---|---|---|---|
| 16 ГБ | Да | Да | Да | до 2.3 с | до 3.8 с |
| 24 ГБ | Да | Да | Да | до 2.3 с | до 5.2 с |
| 32 ГБ | Да | Да | Да | до 3.8 с | до 5.2 с |
Каждое подтвержденное число получено из измеренных запусков, а не оценок: пиковое потребление 8.8 - 12.3 ГБ на карточке 16 ГБ для H3 и 8.4 - 11.0 ГБ для Krea 2. Карточка 12 ГБ всё ещё обучает только LoRA; 16 ГБ: это минимальный порог для дообучения. Два замечания от разработчика: дообучение пока не тестировалось на AMD/ROCm, а для дообучения Krea 2 реалистично требуется 48 ГБ или более системной памяти, так как её мастер-копия размером около 24 ГБ находится в оперативной памяти.
Как дообучение 33B помещается в 16 ГБ
Наивное полное дообучение параметров MiniMax H3 на 33B потребовало бы примерно 200 ГБ памяти. Fizgig вращает обучающее окно через модель: каждый вес обучается за полный цикл, но градиенты и состояние оптимизатора существуют только для активного среза. Оставшаяся замороженная часть модели удерживается в 4-битном формате на карточке, а сохранённый чекпойнт записывается в bf16 из мастер-копии, которая никогда не проходит через квантователь, поэтому выход представляет собой чистое полноPrecision дообучение.
Одна концепция объясняет настройки по умолчанию: один эпоха обучает один срез модели. Обучающее окно вращается каждую эпоху, поэтому полный цикл, обычно 4 эпохи, необходим для того, чтобы каждая часть модели обучилась один раз. Вот почему настройки эпохи выглядят высокими, и почему чекпойнты сохраняются на границах циклов.
Скорость обучения важнее, чем при обучении LoRA
В примечаниях к выпуску это называют единственным числом, которое нужно уважать: дообучение требует гораздо более низких скоростей обучения, чем обучение LoRA. Установка галочки Fine-tune устанавливает безопасное значение 1e-5 для обеих семейств. На MiniMax H3 3e-5: это протестированная более высокая скорость и максимум, который следует использовать; 1e-4 уничтожит дообучение H3. На Krea 2 вы можете экспериментировать до 1e-4, но результаты лучше при меньших значениях.
Экспорт чекпойнта в LoRA для ComfyUI
Встроенная утилита Checkpoint to LoRA сравнивает ваше дообучение с базовой моделью и извлекает обычный, доступный для обмена LoRA любого ранга. По результатам тестирования разработчиков, извлечение ранга 64 было визуально неотличимо от полного чекпойнта, в файле, который ComfyUI загружает нормально. Вы также можете сохранить полный чекпойнт и установить его как базу семейства в Настройках, затем обучать LoRA поверх собственной дообученной модели.
.safetensors, которые можно сразу поместить в ComfyUI/models/loras/. Функция полного дообучения помечена как экспериментальная и в настоящее время поддерживается только NVIDIA.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.