MiniMax H3 Image VAE: декодирование изображения из одного латента
Mamad8 выпускает экспериментальный MiniMax H3 VAE для изображений, который декодирует один временной латентный вектор T=1 напрямую в изображение без пользовательских нод.
Mamad8 выпустил экспериментальный MiniMax H3 VAE, специализированный для изображений, на Hugging Face, о чём сообщил на Reddit 9 августа. Чекпоинт декодирует один временной латентный вектор (T=1) напрямую в одно изображение, обеспечивая работоспособный прямой путь от одного латентного вектора к изображению для 24-канального латентного формата H3. Он распространяется как стандартный объединённый чекпоинт H3 VAE, поэтому пользовательские ноды или отдельная головка декодера не требуются.
Что это такое и чем оно не является
В карточке модели чётко описаны компромиссы:
- Только изображения. Специализированный для изображений декодер существенно ухудшает реконструкцию многокадрового видео и может вызывать двоение на сетке патчей и межкадровое смешивание, поэтому его нельзя использовать вместо оригинального H3 VAE в рабочих процессах с видео.
- Качество ограничено. Результаты могут оставаться размытыми, теряя мелкий текст, тонкие контуры, волосы, листву и микротекстуру. Пример изображения выше показывает реальный результат, а не подразумевает гарантию качества: это утилитарный путь, а не заявление о высокой точности воспроизведения.
Его назначение: обеспечить H3 работоспособный цикл преобразования одиночного изображения, что важно для рабочих процессов, в которых нужно просматривать или редактировать латентное представление H3 как изображение.
Как проводилось обучение
Оригинальный энкодер H3 был заморожен, а полный декодер и post_quant_conv были дообучены для восстановления реального исходного изображения напрямую из одного временного латентного вектора H3. При обучении использовался прогрессивный план увеличения разрешения 256→384 px на 51 083 уникальных изображениях (41 259 изображений Booru Essence и 9 824 псевдокамерных фотографий) с целевой функцией, учитывающей декодер и сочетающей реконструкцию Charbonnier, контурные потери, SSIM и потери FDL/FDL-PIPS с малым весом. Выбранный декодер с шага 1597 был объединён обратно в стандартный чекпоинт H3 VAE, поэтому он загружается обычным инструментарием H3 VAE.
На сбалансированном наборе изображений 512 px, не использовавшемся при обучении (32 фотографии и 32 художественных изображения), чекпоинт показал 30,44 дБ PSNR, 0,939 SSIM и 0,0168 MAE; проверки при разрешениях от ~1 до 3 мегапикселей составили 31,55–33,43 дБ PSNR.
Использование в ComfyUI
- Скачайте
minimax_h3_t1_image_vae_step1597.safetensors(~5,2 ГБ) в папкуComfyUI/models/vae/ - Загрузите его с помощью стандартной ноды Загрузить VAE и используйте обычные ноды кодирования и декодирования VAE
- Модель рассчитана на 24-канальный латентный формат MiniMax H3 и предназначена для циклов преобразования одиночных изображений (
T=1)
Доступность
Чекпоинт доступен на Hugging Face. Он хорошо сочетается с более ранним 2× апскейлером латентного пространства от Mamad8 для рабочих процессов в латентном пространстве H3.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.