MiniMax H3 X2 Detail VAE: релиз 2-в-1 для апскейла и детализации

ComfyUI Wikinews

Экспериментальный релиз 2-в-1 для MiniMax H3: 2X видео VAE плюс узел повышения детализации по референсу и протестированный рабочий процесс ComfyUI.

MiniMax-H3-X2-Detail-VAE это релиз от сообщества для MiniMax H3, который упаковывает две вещи в один 5.2 GB checkpoint: 2X видео VAE, декодирующий латентные представления H3 в двойном разрешении, и опциональный узел повышения детализации по референсу, который восстанавливает мелкую структуру во входном изображении перед референс-в-видео. Автор опубликовал веса, протестированный пользовательский узел и пример рабочего процесса 30 сентября, вместе с длинным разбором того, почему исходная цель (подключаемый VAE с повышенной детализацией) так и не была достигнута.
Сравнительные кадры MiniMax H3 X2 Detail VAE

Кадры из сравнительного клипа релиза: с одной стороны обычное декодирование VAE 2X, с другой тот же латентный набор с путём повышения детализации.

Два инструмента в одном файле

Большинство работ по VAE для H3 на вики были посвящены тому, чтобы сделать декодирование быстрее. Этот релиз идёт в обратную сторону и задаётся вопросом, можно ли сделать декодирование резче, и поставляет всё, что уцелело в этом поиске. Один и тот же checkpoint, MiniMax-H3-X2-Detail-v1.safetensors, используется двумя разными способами:

РежимВходЧто делаетНужен ли пользовательский узел
2X VAEлатентный набор видео H3Декодирует с удвоенным пространственным разрешением через упакованный 12-канальный выход плюс PixelShuffleДа, только для узла быстрого декодирования
Улучшение детализацииRGB-изображение референсаВосстанавливает дополнительную пространственную структуру из раннего ответвления энкодера перед референс-в-видеоДа, включён в релиз

Эти два режима не взаимозаменяемы. Путь 2X работает со сгенерированным латентным набором и не требует изображения-референса. Путь детализации требует существующего RGB-изображения, поскольку дополнительная информация, которую он использует, извлекается из энкодера H3 ДО обычного латентного бутылочного горлышка.

Режим 1: декодирование VAE 2X

Поместите checkpoint в ComfyUI/models/vae/ и выберите его в стандартном узле Загрузить VAE. Для самого декодирования замените обычный узел Декодировать VAE в ComfyUI на MiniMax H3 VAE Decode (fast) из TripleHeadedMonkey/ComfyUI-MiniMaxH3_LatentUpscaler, именно он превращает упакованный выход в RGB полного разрешения.

H3 video latent
   ↓
MiniMax H3 VAE Decode (fast)   ← MiniMax-H3-X2-Detail-v1
   ↓
packed 12-channel X2 decode
   ↓
PixelShuffle ×2
   ↓
2X RGB / video frames

Рабочий процесс поставляется с проверенной стартовой конфигурацией: tiling = true, tile_size = 256, tile_overlap = 64, output_device = cpu, temporal_tiling = false.

Узел MiniMax H3 VAE Decode (fast), необходимый для рабочего процесса 2X

Обязательный узел MiniMax H3 VAE Decode (fast) из README релиза.

Режим 2: повышение детализации по референсу

Для рабочих процессов с изображением-референсом тот же checkpoint загружается второй раз внутри MiniMax H3 VAE 2X (Detailed Upscale), небольшого пользовательского узла, поставляемого в виде ComfyUI-H3-X2-Detailed.zip. Он располагается между исходным изображением и MiniMax H3: референс в видео, а detail_strength = 1.0 это проверенное базовое значение. Финальное декодирование видео по-прежнему проходит через MiniMax H3 VAE Decode (fast) с тем же VAE 2X.

Пример рабочего процесса

Релиз включает граф 2-в-1, который демонстрирует обе роли сразу: узел детализации улучшает RGB-референс перед референс-в-видео, а сгенерированный латентный набор H3 в конце декодируется через MiniMax H3 VAE Decode (fast).

Рабочий процесс H3 X2 Detail VAE 2-в-1

Полный скриншот рабочего процесса 2-в-1 с карточки модели.

Прямое сравнение

Оба клипа ниже запускают одну и ту же модель в двух выпущенных режимах с одинаковыми настройками генерации: Слева VAE 2X сам по себе, Справа VAE 2X плюс путь детализации, где референс сначала обрабатывается через ветвь детализации B32.

Сравнение 01: декодирование VAE 2X против VAE 2X с путём повышения детализации.

Сравнение 02: те же два режима на втором клипе.

Почему нет «HQ VAE»

В разборе результат описан необычно прямо. Отправной точкой был уже работающий H3 2X VAE, чей увеличенный выход не нёс пропорционально больше реальных деталей, поэтому проект задался целью сделать дополнительные пиксели осмысленными. Блоки на стороне декодера, loss-функции по цели детализации, латентные «направления детализации» и более сильные прогрессивные декодеры: всё это не сработало, а некоторые из них улучшали числовую метрику loss, порождая при этом ореолы по краям, структуру, похожую на гравюру, или вообще ничего видимого.

Единственная ветвь, которая явно сработала, извлекала компактное 32-канальное представление из down.1.block.1 замороженного энкодера H3, и она улучшала метрики RMSE, HP3 и градиентные метрики на всех десяти отложенных кадрах. К тому же она происходила из оригинального RGB-изображения до латентного бутылочного горлышка, а это именно та информация, которой не существует, когда H3 генерирует новый латентный набор во время text-to-video. Вывод автора узок и изложен прямо: прирост детализации нельзя воспроизвести только из стандартного сгенерированного латентного набора H3, поэтому он не мог стать тем подключаемым VAE, работающим только с латентным представлением, к которому стремился проект. В итоге остался экспериментальный инструмент 2-в-1, а не решённая проблема узкого места.

Требования и файлы

  • MiniMax-H3-X2-Detail-v1.safetensors, checkpoint размером 5.2 GB, помещается в ComfyUI/models/vae/.
  • ComfyUI-MiniMaxH3_LatentUpscaler предоставляет MiniMax H3 VAE Decode (fast) и требуется для рабочего процесса 2X.
  • ComfyUI-H3-X2-Detailed.zip добавляет опциональный узел MiniMax H3 VAE 2X (Detailed Upscale) для пути с референсом.
  • H3_VAE_Detailed_and_2X_VAE_2in1.json это пример рабочего процесса.

Доступность

Веса и ассеты: speach1sdef178/MiniMax-H3-X2-Detail-VAE
Файл ComfyUI: MiniMax-H3-X2-Detail-v1.safetensors в models/vae/
Обязательный пакет узлов: TripleHeadedMonkey/ComfyUI-MiniMaxH3_LatentUpscaler
Базовая модель: MiniMaxAI/MiniMax-H3

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MiniMax H3 X2 Detail VAE: релиз 2-в-1 для апскейла и детализации | ComfyUI Wiki