MiniMax H3 X2 Detail VAE: релиз 2-в-1 для апскейла и детализации
Экспериментальный релиз 2-в-1 для MiniMax H3: 2X видео VAE плюс узел повышения детализации по референсу и протестированный рабочий процесс ComfyUI.
Кадры из сравнительного клипа релиза: с одной стороны обычное декодирование VAE 2X, с другой тот же латентный набор с путём повышения детализации.
Два инструмента в одном файле
Большинство работ по VAE для H3 на вики были посвящены тому, чтобы сделать декодирование быстрее. Этот релиз идёт в обратную сторону и задаётся вопросом, можно ли сделать декодирование резче, и поставляет всё, что уцелело в этом поиске. Один и тот же checkpoint, MiniMax-H3-X2-Detail-v1.safetensors, используется двумя разными способами:
| Режим | Вход | Что делает | Нужен ли пользовательский узел |
|---|---|---|---|
| 2X VAE | латентный набор видео H3 | Декодирует с удвоенным пространственным разрешением через упакованный 12-канальный выход плюс PixelShuffle | Да, только для узла быстрого декодирования |
| Улучшение детализации | RGB-изображение референса | Восстанавливает дополнительную пространственную структуру из раннего ответвления энкодера перед референс-в-видео | Да, включён в релиз |
Эти два режима не взаимозаменяемы. Путь 2X работает со сгенерированным латентным набором и не требует изображения-референса. Путь детализации требует существующего RGB-изображения, поскольку дополнительная информация, которую он использует, извлекается из энкодера H3 ДО обычного латентного бутылочного горлышка.
Режим 1: декодирование VAE 2X
Поместите checkpoint в ComfyUI/models/vae/ и выберите его в стандартном узле Загрузить VAE. Для самого декодирования замените обычный узел Декодировать VAE в ComfyUI на MiniMax H3 VAE Decode (fast) из TripleHeadedMonkey/ComfyUI-MiniMaxH3_LatentUpscaler, именно он превращает упакованный выход в RGB полного разрешения.
H3 video latent
↓
MiniMax H3 VAE Decode (fast) ← MiniMax-H3-X2-Detail-v1
↓
packed 12-channel X2 decode
↓
PixelShuffle ×2
↓
2X RGB / video framesРабочий процесс поставляется с проверенной стартовой конфигурацией: tiling = true, tile_size = 256, tile_overlap = 64, output_device = cpu, temporal_tiling = false.
Обязательный узел MiniMax H3 VAE Decode (fast) из README релиза.
Режим 2: повышение детализации по референсу
Для рабочих процессов с изображением-референсом тот же checkpoint загружается второй раз внутри MiniMax H3 VAE 2X (Detailed Upscale), небольшого пользовательского узла, поставляемого в виде ComfyUI-H3-X2-Detailed.zip. Он располагается между исходным изображением и MiniMax H3: референс в видео, а detail_strength = 1.0 это проверенное базовое значение. Финальное декодирование видео по-прежнему проходит через MiniMax H3 VAE Decode (fast) с тем же VAE 2X.
Пример рабочего процесса
Релиз включает граф 2-в-1, который демонстрирует обе роли сразу: узел детализации улучшает RGB-референс перед референс-в-видео, а сгенерированный латентный набор H3 в конце декодируется через MiniMax H3 VAE Decode (fast).
Полный скриншот рабочего процесса 2-в-1 с карточки модели.
Прямое сравнение
Оба клипа ниже запускают одну и ту же модель в двух выпущенных режимах с одинаковыми настройками генерации: Слева VAE 2X сам по себе, Справа VAE 2X плюс путь детализации, где референс сначала обрабатывается через ветвь детализации B32.
Сравнение 01: декодирование VAE 2X против VAE 2X с путём повышения детализации.
Сравнение 02: те же два режима на втором клипе.
Почему нет «HQ VAE»
В разборе результат описан необычно прямо. Отправной точкой был уже работающий H3 2X VAE, чей увеличенный выход не нёс пропорционально больше реальных деталей, поэтому проект задался целью сделать дополнительные пиксели осмысленными. Блоки на стороне декодера, loss-функции по цели детализации, латентные «направления детализации» и более сильные прогрессивные декодеры: всё это не сработало, а некоторые из них улучшали числовую метрику loss, порождая при этом ореолы по краям, структуру, похожую на гравюру, или вообще ничего видимого.
Единственная ветвь, которая явно сработала, извлекала компактное 32-канальное представление из down.1.block.1 замороженного энкодера H3, и она улучшала метрики RMSE, HP3 и градиентные метрики на всех десяти отложенных кадрах. К тому же она происходила из оригинального RGB-изображения до латентного бутылочного горлышка, а это именно та информация, которой не существует, когда H3 генерирует новый латентный набор во время text-to-video. Вывод автора узок и изложен прямо: прирост детализации нельзя воспроизвести только из стандартного сгенерированного латентного набора H3, поэтому он не мог стать тем подключаемым VAE, работающим только с латентным представлением, к которому стремился проект. В итоге остался экспериментальный инструмент 2-в-1, а не решённая проблема узкого места.
Требования и файлы
MiniMax-H3-X2-Detail-v1.safetensors, checkpoint размером 5.2 GB, помещается вComfyUI/models/vae/.- ComfyUI-MiniMaxH3_LatentUpscaler предоставляет
MiniMax H3 VAE Decode (fast)и требуется для рабочего процесса 2X. ComfyUI-H3-X2-Detailed.zipдобавляет опциональный узелMiniMax H3 VAE 2X (Detailed Upscale)для пути с референсом.H3_VAE_Detailed_and_2X_VAE_2in1.jsonэто пример рабочего процесса.
Доступность
Веса и ассеты: speach1sdef178/MiniMax-H3-X2-Detail-VAE
Файл ComfyUI: MiniMax-H3-X2-Detail-v1.safetensors в models/vae/
Обязательный пакет узлов: TripleHeadedMonkey/ComfyUI-MiniMaxH3_LatentUpscaler
Базовая модель: MiniMaxAI/MiniMax-H3
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.