MiniMax H3 Fused Turbo: Один файл 21 ГБ, видео и аудио за 4 шага
MATLOWAI объединяет H3 turbo и Mystic LoRA в один файл ComfyUI INT8 ConvRot: текст/изображение-в-видео и референс-в-видео с аудио за 4 шага, экономя около 21 ГБ VRAM.
Запуск референса за один проход за 4 шага: 1152x640, 243 кадра (10 с с аудио), 76 секунд на одной RTX PRO 6000.
Что внутри файла
Процесс объединения начинается с урезанного трансформера fl2va, в который встроена SVD ранга 1024 дельты весов (ref2va - fl2va), поэтому один раздел обслуживает как условие первого/последнего кадра, так и условие референса одновременно. Дополнительно к этому:
| Встроено | Сила | Источник |
|---|---|---|
| lightx2v FL2VA Turbo 8-step v1.0 | 1.0 | Kijai/MiniMax-H3_comfy, resize ранга-24 (оригинал) |
| Mystic v2.0 (motion smoothness) | 0.7 | Civitai model 2856467 |
Один проход квантования INT8 ConvRot выполняется ПОСЛЕ объединения: четыре тяжёлых линейных веса в каждом из 50 блоков (qkv_proj, out_proj, fc1, fc2) имеют формат INT8 с ConvRot (группа 256, по каналам) в нативном макете comfy_quant ComfyUI, всё остальное остаётся BF16/F32. Этот порядок важен: квантование объединённых весов предотвращает смещение квантованной базы с плавающими дельтами, а тесты с тем же семплом показали идентичность результата пути живых LoRA.
Почему объединить вместо наложения LoRA
Два файла LoRA вместе занимают около 540 МБ, поэтому адаптеры не являются проблемой. LoRA: это низкоранговая дельта, которую ComfyUI добавляет при загрузке; чтобы оставаться удаляемой, она хранит чистую копию каждого затронутого веса. Запатчить все 200 основных слоёв модели INT8 и эта резервная копия становится второй полной моделью в памяти. Измерено дважды за 8 шагов на том же семпле:
| Настройка | Пиковая VRAM | Резидентная | Время выполнения |
|---|---|---|---|
| Объединённый (этот файл) | 47.8 GB | 42 GB | 103 s |
| Живые LoRA | 68.9 GB | 64 GB | 103 s |
Тот же кадр, то же время выполнения, метрики аудио идентичны в пределах шума. Бейк просто убирает два загрузчика, один проход квантования туда-обратно и резервный патч ~21 ГБ. Если вам нужны регулируемые силы LoRA, README документирует эквивалентный путь живых файлов с общедоступными файлами.
Шаги: написано 8, запускаем на 4
Объединённое турбо — это 8-шаговый LoRA от lightx2v, но это модель с 4 или 8 NFE. Измеренная лестница на одной RTX PRO 6000 (96 ГБ), 1152x640, 243 кадра, SLA разреженное внимание:
| Конвейер | Шаги | Время |
|---|---|---|
| Референс, одиночный проход | 4 | 76 s |
| Референс, одиночный проход | 6 | 80 s |
| Референс, одиночный проход | 8 | 103 s |
| Референс, одиночный проход | 25 | 292 s |
| Де-ропе (4 + 4) | 4 + 4 | ~374 s |
Тот же кадр на 25 шагах: чуть более резкая прорисовка, 292 секунды вместо 76, саундтрек без изменений.
Де-ропе: причина использовать 4 шага; второй проход затрачивает шаги только на кадры, отмеченные детектором рывков, поэтому 4 + 4 вместе обходятся примерно так же, как один проход на 25 шагов, при этом удержанные области получаются чище. Два вывода рецепта важны: res_multistep лучше euler по качеству аудио на 4 шагах (примерные графики lightx2v указывают euler), и SLA блочное разреженное внимание при разреженности 0.90 заметно на слух, восстанавливая детали верхнего диапазона саундтрека, которые плотное внимание сглаживает, при этом работая примерно на 40% быстрее.
Рабочие процессы
Репозиторий содержит пять графов ComfyUI (формат UI и API), каждый с одной коробкой PROMPT, питающей каждый этап. Требуется ComfyUI-MAINodes и пакет узлов SLA разреженного внимания:
Начало работы
- Скачайте
minimax_h3_fused_refdelta_r1024_turbo8_mystic07_int8_convrot.safetensors(21 ГБ) вComfyUI/models/diffusion_models/и загрузите его стандартнымUNETLoader, weight_dtypedefault. Пользовательский загрузчик квантования не требуется. - Скачайте сопутствующие файлы из Comfy-Org/MiniMax-H3:
minimax_h3_video_vae_int8_convrot.safetensors,minimax_h3_audio_vae_fp32.safetensors(VAE) иqwen3vl_32b_minimax_h3_nvfp4_awq.safetensors(текстовый энкодер). - Установите ComfyUI-MAINodes и пакет узлов SLA разреженного внимания, затем перетащите один из рабочих процессов выше.
Меньшие карты тоже работают: управление моделями ComfyUI загружает и выгружает трансформер, текстовый энкодер и VAE по мере необходимости, поэтому те же графы выполняются, просто медленнее. Для AMD/ROCm рецепт был разработан на машине AMD с форком ComfyUI ROCm от patientx, который также содержит сборку ROCm для узла внимания SLA.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.