MiniMax H3 Latent Upscaler 3D: нейронный апскейл с нодами ComfyUI

ComfyUI Wikinews

LBH-123 выпускает 3D-нейросетевой латент-апскейлер для MiniMax H3 с нодами ComfyUI: масштабирует 24-канальные видео-латентты для ускорения генерации в высоком разрешении.

Minimax H3 Latent Upscaler (Hugging Face | Кастомные ноды) — нейронный апскейлер в latent-пространстве для генерации видео MiniMax H3, выпущенный LBH-123 17 августа 2026 года вместе с парой кастомных нод ComfyUI. Он масштабирует 24-канальный VAE-латент H3 напрямую, поэтому генерация в высоком разрешении может пропустить дорогой цикл декодирование → пиксельный апскейл → повторное кодирование.

Что это

Модель работает напрямую с 24-канальными VAE-латентами MiniMax H3, увеличивая пространственное разрешение (H × W) и сохраняя временное измерение. Обученная нейросеть заменяет наивную билинейную/бикубическую интерполяцию латентов, избегая артефактов двоения и «призраков», которые даёт простое масштабирование.

Основная цель — ускорить генерацию H3-видео в высоком разрешении:

  1. Сгенерируйте видео в низком разрешении — гораздо меньше latent-токенов, заметно быстрее.
  2. Увеличьте латент на месте обученным апскейлером.
  3. Повторно сэмплируйте или уточните в целевом разрешении, чтобы восстановить детали.

Пропуская медленный цикл декодирование → пиксельный апскейл → кодирование через тяжёлый VAE H3 (~5 млрд параметров), этот пайплайн существенно экономит время генерации. Обратите внимание: экономится время, а не VRAM — шаг уточнения всё равно выполняется в целевом разрешении, так что пиковое потребление памяти сравнимо с прямой генерацией в высоком разрешении.

Пак кастомных нод содержит два варианта нод в категории video/MinimaxH3:

  • Minimax H3 Latent Upscaler (2D) — лёгкий и быстрый вариант с 2D-бэкбоном ResBlock и вставленными временными 3D-свёртками, использует простой множитель scale (1.0×–4.0×).
  • Minimax H3 Latent Upscaler (3D) — полностью 3D-свёрточный бэкбон, обрабатывающий пространственно-временной объём совместно для более сильной временной согласованности; в одной ноде три режима изменения размера: scale by multiplier, target dimensions и megapixels (с выравниванием по пиксельной сетке и фиксацией соотношения сторон).

Обе ноды поддерживают только увеличение (effective scale >= 1.0) и предлагают инференс fp32 / fp16 / bf16. В недавних обновлениях добавлены переключатель enable_chunking для длинных видео (со сглаживанием границ временных чанков), автоматическая выгрузка модели в CPU после выполнения и поддержка бэкенда ROCm (GPU AMD).

Примеры

В репозитории есть сравнение апскейла для видео и изображения:

Сравнение апскейла видео (нажмите для воспроизведения)

Сравнение апскейла изображения

Сравнение апскейла изображения

Использование в ComfyUI

  1. Склонируйте Comfyui_Minimax_h3_latent_Upscaler в ComfyUI/custom_nodes/ и перезапустите ComfyUI. Дополнительные Python-пакеты не требуются.
  2. Скачайте один из чекпоинтов (bf16 / fp16, ~691 МБ каждый, либо fp32 .pth) в ComfyUI/models/latent_upscale_models/. Загрузчик сам определяет архитектуру, поэтому один чекпоинт работает и в 2D-, и в 3D-ноде.

Типовой воркфлоу: [Низкоразрешённый H3 Latent] → [H3 Latent Upscaler] → [Уточнение / повторный сэмплинг] → [VAE Decode]. В пак нод включены примеры воркфлоу I2V и R2V:

Более ранний 2x латент-апскейлер H3 от Mamad8 рассчитан на чистые латенты после сэмплинга; этот релиз использует похожий подход в latent-пространстве с более тяжёлым 3D-бэкбоном, а также поддерживает прямое изменение размера по целевым размерам и мегапикселям.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MiniMax H3 Latent Upscaler 3D: нейронный апскейл с нодами ComfyUI | ComfyUI Wiki