MiniMax H3 Latent Upscaler 3D: нейронный апскейл с нодами ComfyUI
LBH-123 выпускает 3D-нейросетевой латент-апскейлер для MiniMax H3 с нодами ComfyUI: масштабирует 24-канальные видео-латентты для ускорения генерации в высоком разрешении.
Что это
Модель работает напрямую с 24-канальными VAE-латентами MiniMax H3, увеличивая пространственное разрешение (H × W) и сохраняя временное измерение. Обученная нейросеть заменяет наивную билинейную/бикубическую интерполяцию латентов, избегая артефактов двоения и «призраков», которые даёт простое масштабирование.
Основная цель — ускорить генерацию H3-видео в высоком разрешении:
- Сгенерируйте видео в низком разрешении — гораздо меньше latent-токенов, заметно быстрее.
- Увеличьте латент на месте обученным апскейлером.
- Повторно сэмплируйте или уточните в целевом разрешении, чтобы восстановить детали.
Пропуская медленный цикл декодирование → пиксельный апскейл → кодирование через тяжёлый VAE H3 (~5 млрд параметров), этот пайплайн существенно экономит время генерации. Обратите внимание: экономится время, а не VRAM — шаг уточнения всё равно выполняется в целевом разрешении, так что пиковое потребление памяти сравнимо с прямой генерацией в высоком разрешении.
Пак кастомных нод содержит два варианта нод в категории video/MinimaxH3:
- Minimax H3 Latent Upscaler (2D) — лёгкий и быстрый вариант с 2D-бэкбоном ResBlock и вставленными временными 3D-свёртками, использует простой множитель
scale(1.0×–4.0×). - Minimax H3 Latent Upscaler (3D) — полностью 3D-свёрточный бэкбон, обрабатывающий пространственно-временной объём совместно для более сильной временной согласованности; в одной ноде три режима изменения размера:
scale by multiplier,target dimensionsиmegapixels(с выравниванием по пиксельной сетке и фиксацией соотношения сторон).
Обе ноды поддерживают только увеличение (effective scale >= 1.0) и предлагают инференс fp32 / fp16 / bf16. В недавних обновлениях добавлены переключатель enable_chunking для длинных видео (со сглаживанием границ временных чанков), автоматическая выгрузка модели в CPU после выполнения и поддержка бэкенда ROCm (GPU AMD).
Примеры
В репозитории есть сравнение апскейла для видео и изображения:
Сравнение апскейла видео (нажмите для воспроизведения)
Сравнение апскейла изображения
Использование в ComfyUI
- Склонируйте
Comfyui_Minimax_h3_latent_UpscalerвComfyUI/custom_nodes/и перезапустите ComfyUI. Дополнительные Python-пакеты не требуются. - Скачайте один из чекпоинтов (bf16 / fp16, ~691 МБ каждый, либо fp32
.pth) вComfyUI/models/latent_upscale_models/. Загрузчик сам определяет архитектуру, поэтому один чекпоинт работает и в 2D-, и в 3D-ноде.
Типовой воркфлоу: [Низкоразрешённый H3 Latent] → [H3 Latent Upscaler] → [Уточнение / повторный сэмплинг] → [VAE Decode]. В пак нод включены примеры воркфлоу I2V и R2V:
Более ранний 2x латент-апскейлер H3 от Mamad8 рассчитан на чистые латенты после сэмплинга; этот релиз использует похожий подход в latent-пространстве с более тяжёлым 3D-бэкбоном, а также поддерживает прямое изменение размера по целевым размерам и мегапикселям.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.