MiniMax H3 Fused Turbo: Один файл 21 ГБ, видео и аудио за 4 шага

ComfyUI Wikinews

MATLOWAI объединяет H3 turbo и Mystic LoRA в один файл ComfyUI INT8 ConvRot: текст/изображение-в-видео и референс-в-видео с аудио за 4 шага, экономя около 21 ГБ VRAM.

MiniMax-H3 Fused Turbo (INT8 ConvRot) (Hugging Face) : единый 21 ГБ файл диффузионной модели ComfyUI от MATLOWAI, который выполняет MiniMax H3 текст/изображение-в-видео и референс-в-видео за 4 шага, с дистиллированным турбо и LoRA сглаживания движения уже встроенными в веса. Никаких загрузчиков LoRA, никакого квантования туда-обратно, и примерно на 21 ГБ меньше VRAM, чем эквивалентная настройка с живыми LoRA.

Запуск референса за один проход за 4 шага: 1152x640, 243 кадра (10 с с аудио), 76 секунд на одной RTX PRO 6000.

Что внутри файла

Процесс объединения начинается с урезанного трансформера fl2va, в который встроена SVD ранга 1024 дельты весов (ref2va - fl2va), поэтому один раздел обслуживает как условие первого/последнего кадра, так и условие референса одновременно. Дополнительно к этому:

ВстроеноСилаИсточник
lightx2v FL2VA Turbo 8-step v1.01.0Kijai/MiniMax-H3_comfy, resize ранга-24 (оригинал)
Mystic v2.0 (motion smoothness)0.7Civitai model 2856467

Один проход квантования INT8 ConvRot выполняется ПОСЛЕ объединения: четыре тяжёлых линейных веса в каждом из 50 блоков (qkv_proj, out_proj, fc1, fc2) имеют формат INT8 с ConvRot (группа 256, по каналам) в нативном макете comfy_quant ComfyUI, всё остальное остаётся BF16/F32. Этот порядок важен: квантование объединённых весов предотвращает смещение квантованной базы с плавающими дельтами, а тесты с тем же семплом показали идентичность результата пути живых LoRA.

Почему объединить вместо наложения LoRA

Два файла LoRA вместе занимают около 540 МБ, поэтому адаптеры не являются проблемой. LoRA: это низкоранговая дельта, которую ComfyUI добавляет при загрузке; чтобы оставаться удаляемой, она хранит чистую копию каждого затронутого веса. Запатчить все 200 основных слоёв модели INT8 и эта резервная копия становится второй полной моделью в памяти. Измерено дважды за 8 шагов на том же семпле:

НастройкаПиковая VRAMРезидентнаяВремя выполнения
Объединённый (этот файл)47.8 GB42 GB103 s
Живые LoRA68.9 GB64 GB103 s

Тот же кадр, то же время выполнения, метрики аудио идентичны в пределах шума. Бейк просто убирает два загрузчика, один проход квантования туда-обратно и резервный патч ~21 ГБ. Если вам нужны регулируемые силы LoRA, README документирует эквивалентный путь живых файлов с общедоступными файлами.

Шаги: написано 8, запускаем на 4

Объединённое турбо — это 8-шаговый LoRA от lightx2v, но это модель с 4 или 8 NFE. Измеренная лестница на одной RTX PRO 6000 (96 ГБ), 1152x640, 243 кадра, SLA разреженное внимание:

КонвейерШагиВремя
Референс, одиночный проход476 s
Референс, одиночный проход680 s
Референс, одиночный проход8103 s
Референс, одиночный проход25292 s
Де-ропе (4 + 4)4 + 4~374 s

Тот же кадр на 25 шагах: чуть более резкая прорисовка, 292 секунды вместо 76, саундтрек без изменений.

Де-ропе: причина использовать 4 шага; второй проход затрачивает шаги только на кадры, отмеченные детектором рывков, поэтому 4 + 4 вместе обходятся примерно так же, как один проход на 25 шагов, при этом удержанные области получаются чище. Два вывода рецепта важны: res_multistep лучше euler по качеству аудио на 4 шагах (примерные графики lightx2v указывают euler), и SLA блочное разреженное внимание при разреженности 0.90 заметно на слух, восстанавливая детали верхнего диапазона саундтрека, которые плотное внимание сглаживает, при этом работая примерно на 40% быстрее.

Рабочие процессы

Репозиторий содержит пять графов ComfyUI (формат UI и API), каждый с одной коробкой PROMPT, питающей каждый этап. Требуется ComfyUI-MAINodes и пакет узлов SLA разреженного внимания:

Начало работы

  1. Скачайте minimax_h3_fused_refdelta_r1024_turbo8_mystic07_int8_convrot.safetensors (21 ГБ) в ComfyUI/models/diffusion_models/ и загрузите его стандартным UNETLoader, weight_dtype default. Пользовательский загрузчик квантования не требуется.
  2. Скачайте сопутствующие файлы из Comfy-Org/MiniMax-H3: minimax_h3_video_vae_int8_convrot.safetensors, minimax_h3_audio_vae_fp32.safetensors (VAE) и qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors (текстовый энкодер).
  3. Установите ComfyUI-MAINodes и пакет узлов SLA разреженного внимания, затем перетащите один из рабочих процессов выше.

Меньшие карты тоже работают: управление моделями ComfyUI загружает и выгружает трансформер, текстовый энкодер и VAE по мере необходимости, поэтому те же графы выполняются, просто медленнее. Для AMD/ROCm рецепт был разработан на машине AMD с форком ComfyUI ROCm от patientx, который также содержит сборку ROCm для узла внимания SLA.

Ссылки

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MiniMax H3 Fused Turbo: Один файл 21 ГБ, видео и аудио за 4 шага | ComfyUI Wiki