MiniMax H3 Fun ControlNet Union: управление Canny, Depth, Pose и др.
Alibaba PAI выпускает ControlNet-Union для MiniMax H3: один чекпоинт на 6,8 ГБ добавляет управление видео Canny, Depth, HED, MLSD и Pose, а также инпейнтинг, через VideoX-Fun.
Что это
Чекпоинт содержит только управляющую ветвь (control_proj_in плюс пять control_blocks, около 6,8 ГБ) и загружается поверх базового трансформера MiniMax H3. Управляющие сигналы подаются в пять из 50 блоков трансформера (слои 0, 10, 20, 30 и 40), и каждый управляющий скип добавляется в основную ветвь через проекцию с нулевым гейтом.
- Union-управление — один чекпоинт работает с управляющими видео Canny, Depth, HED, MLSD и Pose для генерации видео-из-видео.
- Дистилляция guidance — запускается с
guidance_scale = 1.0и одним прямым проходом на шаг; classifier-free guidance не нужен. - Инпейнтинг — управляющий вход расширяется до 49 каналов (latent + замаскированный latent + маска); используйте специальный пример
predict_v2v_control_inpaint.py. - Сила управления —
control_context_scaleмасштабирует каждый управляющий скип перед добавлением в основную ветвь:1.0даёт самое сильное управление, меньшие значения ослабляют его,0.0отключает управляющую ветвь.
Генерация следует за управляющим видео: число кадров подгоняется под наибольшее 17 × n + 5, которое может декодировать видео-VAE (длительность ограничена 15 секундами), холст сохраняет соотношение сторон управляющего видео в пределах пиксельного бюджета height × width, при фиксированных 24 fps. Подробные промпты с описанием сцены, объекта и камеры дают самые стабильные результаты.
Результаты
Все примеры ниже сгенерированы с 40 шагами инференса, guidance_scale = 1.0 и control_context_scale = 1.00. Первое видео — управляющий вход, второе — сгенерированный результат.
Canny
Управляющий вход Canny (улица Токио)
Сгенерированный результат, следующий структуре Canny
Pose
Управляющий вход Pose (танец)
Сгенерированный результат, следующий позе танца
Доступность
Чекпоинт запускается через пайплайн инференса VideoX-Fun. Склонируйте репозиторий VideoX-Fun, поместите базовую модель MiniMax-H3 и этот чекпоинт в models/Diffusion_Transformer/, затем отредактируйте настройки в начале examples/minimax_h3_fun/predict_v2v_control.py и запустите:
model_name = "models/Diffusion_Transformer/MiniMax-H3"
config_path = "config/minimax_h3/minimax_h3_control.yaml"
transformer_path = "models/Diffusion_Transformer/MiniMax-H3-Fun-Controlnet-Union/MiniMax-H3-Fun-Controlnet-Union.safetensors"
control_video = "your_control_video.mp4"
prompt = "your prompt"python examples/minimax_h3_fun/predict_v2v_control.pyВажные примечания по настройке из карточки модели:
- Конфиг должен строить управляющую ветвь точно так же, как при обучении (
control_blocks_places: [0, 10, 20, 30, 40],control_in_dim: 49,control_apply_audio: false); несовпадение раскладки не даст чекпоинту загрузиться. - Чекпоинт дистиллирован по guidance: держите
guidance_scale = 1.0; значения выше применяют guidance дважды и ухудшают результат. - Управляющий чекпоинт содержит только управляющую ветвь — базовые веса MiniMax-H3 обязательны.
- Трансформер (~62 ГБ) плюс текстовый энкодер Qwen3-VL (~62 ГБ) не помещаются целиком в одну GPU на 80 ГБ; используйте
model_group_offloadилиmodel_cpu_offload_and_qfloat8.
Нативного загрузчика ComfyUI для H3 ControlNet пока нет — релиз рассчитан на пайплайн VideoX-Fun. Демо Space на Gradio показывает модель с пятью опубликованными парами результатов.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.