MiniMax H3 Fun ControlNet Union: управление Canny, Depth, Pose и др.

ComfyUI Wikinews

Alibaba PAI выпускает ControlNet-Union для MiniMax H3: один чекпоинт на 6,8 ГБ добавляет управление видео Canny, Depth, HED, MLSD и Pose, а также инпейнтинг, через VideoX-Fun.

MiniMax H3 Fun ControlNet Union (Hugging Face | VideoX-Fun | Демо Space) — это ControlNet-Union для MiniMax H3, выпущенный Alibaba PAI 24 августа 2026 года. Один чекпоинт (~6,8 ГБ) задаёт условия для генератора видео H3 с помощью управляющих видео Canny, Depth, HED, MLSD или Pose, а также поддерживает инпейнтинг видео — без переключения чекпоинтов под каждое условие.

Что это

Чекпоинт содержит только управляющую ветвь (control_proj_in плюс пять control_blocks, около 6,8 ГБ) и загружается поверх базового трансформера MiniMax H3. Управляющие сигналы подаются в пять из 50 блоков трансформера (слои 0, 10, 20, 30 и 40), и каждый управляющий скип добавляется в основную ветвь через проекцию с нулевым гейтом.

  • Union-управление — один чекпоинт работает с управляющими видео Canny, Depth, HED, MLSD и Pose для генерации видео-из-видео.
  • Дистилляция guidance — запускается с guidance_scale = 1.0 и одним прямым проходом на шаг; classifier-free guidance не нужен.
  • Инпейнтинг — управляющий вход расширяется до 49 каналов (latent + замаскированный latent + маска); используйте специальный пример predict_v2v_control_inpaint.py.
  • Сила управленияcontrol_context_scale масштабирует каждый управляющий скип перед добавлением в основную ветвь: 1.0 даёт самое сильное управление, меньшие значения ослабляют его, 0.0 отключает управляющую ветвь.

Генерация следует за управляющим видео: число кадров подгоняется под наибольшее 17 × n + 5, которое может декодировать видео-VAE (длительность ограничена 15 секундами), холст сохраняет соотношение сторон управляющего видео в пределах пиксельного бюджета height × width, при фиксированных 24 fps. Подробные промпты с описанием сцены, объекта и камеры дают самые стабильные результаты.

Результаты

Все примеры ниже сгенерированы с 40 шагами инференса, guidance_scale = 1.0 и control_context_scale = 1.00. Первое видео — управляющий вход, второе — сгенерированный результат.

Canny

Управляющий вход Canny (улица Токио)

Сгенерированный результат, следующий структуре Canny

Pose

Управляющий вход Pose (танец)

Сгенерированный результат, следующий позе танца

Доступность

Чекпоинт запускается через пайплайн инференса VideoX-Fun. Склонируйте репозиторий VideoX-Fun, поместите базовую модель MiniMax-H3 и этот чекпоинт в models/Diffusion_Transformer/, затем отредактируйте настройки в начале examples/minimax_h3_fun/predict_v2v_control.py и запустите:

model_name          = "models/Diffusion_Transformer/MiniMax-H3"
config_path         = "config/minimax_h3/minimax_h3_control.yaml"
transformer_path    = "models/Diffusion_Transformer/MiniMax-H3-Fun-Controlnet-Union/MiniMax-H3-Fun-Controlnet-Union.safetensors"
control_video       = "your_control_video.mp4"
prompt              = "your prompt"
python examples/minimax_h3_fun/predict_v2v_control.py

Важные примечания по настройке из карточки модели:

  • Конфиг должен строить управляющую ветвь точно так же, как при обучении (control_blocks_places: [0, 10, 20, 30, 40], control_in_dim: 49, control_apply_audio: false); несовпадение раскладки не даст чекпоинту загрузиться.
  • Чекпоинт дистиллирован по guidance: держите guidance_scale = 1.0; значения выше применяют guidance дважды и ухудшают результат.
  • Управляющий чекпоинт содержит только управляющую ветвь — базовые веса MiniMax-H3 обязательны.
  • Трансформер (~62 ГБ) плюс текстовый энкодер Qwen3-VL (~62 ГБ) не помещаются целиком в одну GPU на 80 ГБ; используйте model_group_offload или model_cpu_offload_and_qfloat8.

Нативного загрузчика ComfyUI для H3 ControlNet пока нет — релиз рассчитан на пайплайн VideoX-Fun. Демо Space на Gradio показывает модель с пятью опубликованными парами результатов.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MiniMax H3 Fun ControlNet Union: управление Canny, Depth, Pose и др. | ComfyUI Wiki