MiniMax H3 Image VAE: декодирование изображения из одного латента

ComfyUI Wikinews

Mamad8 выпускает экспериментальный MiniMax H3 VAE для изображений, который декодирует один временной латентный вектор T=1 напрямую в изображение без пользовательских нод.

Mamad8 выпустил экспериментальный MiniMax H3 VAE, специализированный для изображений, на Hugging Face, о чём сообщил на Reddit 9 августа. Чекпоинт декодирует один временной латентный вектор (T=1) напрямую в одно изображение, обеспечивая работоспособный прямой путь от одного латентного вектора к изображению для 24-канального латентного формата H3. Он распространяется как стандартный объединённый чекпоинт H3 VAE, поэтому пользовательские ноды или отдельная головка декодера не требуются.

Исходные изображения (слева) и реконструкции VAE (справа)

Что это такое и чем оно не является

В карточке модели чётко описаны компромиссы:

  • Только изображения. Специализированный для изображений декодер существенно ухудшает реконструкцию многокадрового видео и может вызывать двоение на сетке патчей и межкадровое смешивание, поэтому его нельзя использовать вместо оригинального H3 VAE в рабочих процессах с видео.
  • Качество ограничено. Результаты могут оставаться размытыми, теряя мелкий текст, тонкие контуры, волосы, листву и микротекстуру. Пример изображения выше показывает реальный результат, а не подразумевает гарантию качества: это утилитарный путь, а не заявление о высокой точности воспроизведения.

Его назначение: обеспечить H3 работоспособный цикл преобразования одиночного изображения, что важно для рабочих процессов, в которых нужно просматривать или редактировать латентное представление H3 как изображение.

Как проводилось обучение

Оригинальный энкодер H3 был заморожен, а полный декодер и post_quant_conv были дообучены для восстановления реального исходного изображения напрямую из одного временного латентного вектора H3. При обучении использовался прогрессивный план увеличения разрешения 256→384 px на 51 083 уникальных изображениях (41 259 изображений Booru Essence и 9 824 псевдокамерных фотографий) с целевой функцией, учитывающей декодер и сочетающей реконструкцию Charbonnier, контурные потери, SSIM и потери FDL/FDL-PIPS с малым весом. Выбранный декодер с шага 1597 был объединён обратно в стандартный чекпоинт H3 VAE, поэтому он загружается обычным инструментарием H3 VAE.

На сбалансированном наборе изображений 512 px, не использовавшемся при обучении (32 фотографии и 32 художественных изображения), чекпоинт показал 30,44 дБ PSNR, 0,939 SSIM и 0,0168 MAE; проверки при разрешениях от ~1 до 3 мегапикселей составили 31,55–33,43 дБ PSNR.

Использование в ComfyUI

  1. Скачайте minimax_h3_t1_image_vae_step1597.safetensors (~5,2 ГБ) в папку ComfyUI/models/vae/
  2. Загрузите его с помощью стандартной ноды Загрузить VAE и используйте обычные ноды кодирования и декодирования VAE
  3. Модель рассчитана на 24-канальный латентный формат MiniMax H3 и предназначена для циклов преобразования одиночных изображений (T=1)

Доступность

Чекпоинт доступен на Hugging Face. Он хорошо сочетается с более ранним 2× апскейлером латентного пространства от Mamad8 для рабочих процессов в латентном пространстве H3.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MiniMax H3 Image VAE: декодирование изображения из одного латента | ComfyUI Wiki