MiniMax H3 Turbo LoRA: предпросмотр генерации видео и аудио за 4 шага
LoRA от сообщества генерирует видео MiniMax H3 с синхронизированным стерео-аудио за 4 шага выборки вместо ~20. Включены конвертация для ComfyUI и пример рабочего процесса.
LoRA от сообщества для MiniMax H3 генерирует видео вместе с синхронизированным стерео-аудио за 4 шага выборки вместо обычных ~20, что ускоряет время выборки примерно в 5 раз. Выпущенная 5 августа larryvrh в качестве раннего предпросмотра, это первая скоростная LoRA для модели H3 с открытыми весами (читайте историю об открытых весах).
Это ранний прототип. Веса и инструментарий ComfyUI находятся в процессе разработки: 4 шага работают, но результат получается заметно мягче, а для резкости сейчас комфортна зона 6-8 шагов. Относитесь к этому как к предпросмотру, а не к готовому продукту.
Веса
Все файлы в формате bf16, около 744 МБ, применяются как стандартное низкоранговое обновление (W_eff = W + lora_B @ lora_A, Альфа равна рангу, без дополнительного масштабирования). LoRA нацелена на базовый трансформер H3: видеопоток и аудиопоток работают по двум разным расписаниям flow, поэтому стандартный сэмплер при 4 шагах делает для аудио лишние шаги и ломает его. С этим справляется пользовательская нода сэмплера.
| Файл | ~Шагов обучения | Примечания |
|---|---|---|
minimax_h3_turbo_4step_ckpt500.safetensors | ~500 | Рекомендуемый вариант по умолчанию: новейший, самый резкий (не EMA) |
minimax_h3_turbo_4step_ema_ckpt500.safetensors | ~500 | Усредненный по времени вариант: более гладкий, но на этом раннем чекпойнте может давать двоение (ghosting) |
minimax_h3_turbo_4step.safetensors | ~200 | Первоначальный выпуск, не EMA |
minimax_h3_turbo_4step_ema.safetensors | ~200 | Первоначальный выпуск, усредненный по времени (заменен) |
LoRA требует необрезанный базовый чекпойнт: модель диффузии bf16 или полную INT8 convrot. Обрезанные варианты используют другой слой временного кондиционирования и несовместимы. Отдельно доступна конвертация, совместимая с обрезанными моделями (см. ниже).
Использование в ComfyUI
Оригинальный выпуск требует пользовательские ноды (ComfyUI-MiniMax-H3-Turbo, устанавливается через ComfyUI-Manager или git clone в custom_nodes) плюс файл minimax_h3_turbo_4step*.safetensors в models/loras/:
- Установите пользовательские ноды.
- Скачайте файл
.safetensorsвComfyUI/models/loras/. - Начните с официального рабочего процесса MiniMax H3 с открытыми весами, вставьте Turbo LoRA между загрузчиком модели и сэмплером, затем замените сэмплер на MiniMax-H3 Turbo Sampler (4-step), установив scheduler в значение
simple.
Готовый рабочий процесс «текст в видео» включен в репозиторий (minimax_h3_t2v_turbo.json) и в примеры рабочих процессов в репозитории нод.
Это не нативная поддержка ComfyUI: скоростная LoRA зависит от сторонних пользовательских нод
ComfyUI-MiniMax-H3-Turbo.
Конвертация для обрезанных моделей
Обрезанные чекпойнты H3 в форме кривой (curve), которые используются в ComfyUI, требуют преобразования ключей. drbaph опубликовал minimax_h3_turbo_4step_ckpt500_pruned_comfyui.safetensors (плюс вариант EMA) на MiniMax-H3-Turbo-Lora-ComfyUI, он загружается встроенным загрузчиком LoRA MiniMax-H3 в ComfyUI, и приложил пример рабочего процесса (fl_minimax_h3_turbo_lora_example_workflow.json). QrusherZA также опубликовал конвертацию для обрезанных моделей в одном файле на H3_Turbo_ComfyUI.
Ранние тесты сообщества при силе LoRA 1.0 и сэмплере Euler/Beta сообщают о резком результате за 4 шага: аудиопоток сейчас является слабым местом этого раннего чекпойнта.
Доступность
- Оригинальные веса: larryvrh/MiniMax-H3-Turbo-Lora (Apache-2.0)
- Пользовательские ноды: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Конвертация для обрезанных моделей: drbaph/MiniMax-H3-Turbo-Lora-ComfyUI, QrusherZA/H3_Turbo_ComfyUI
- Каталог: записи Turbo LoRA добавлены на страницу модели MiniMax H3 с пометкой об обязательных пользовательских нодах
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.