MiniMax H3 VAE 500K: более чёткое декодирование изображения
iamkaikai дообучает декодер изображений H3 на 500K шагов, создавая однофреймовый чекпоинт VAE, который декодирует одно изображение из среза латентного пространства H3.
iamkaikai выпустил независимый экспериментальный чекпоинт только декодер для MiniMax H3: Single-Frame VAE 500K декодирует одно изображение из одного временного среза латентного пространства H3 (Hugging Face). Он продолжает работу изображение-специализированного VAE H3 от Mamad8 с 500 000 дополнительных шагов обучения на примерах реконструкции изображений.
Два фиксированных перехода редактирования, декодированных однофреймовым декодером 500K
Что это и чем не является
Этот чекпоинт — модель только декодер: без энкодера и трансформера, и это не полная замена MiniMax H3. Он дообучен на базе Mamad8/MiniMax-H3-Image-VAE с замороженным H3-совместимым энкодером: полный декодер и post_quant_conv обучались на 500 000 уникальных примерах реконструкции изображений без текста и подписей.
Карточка модели прямо описывает компромиссы:
- Лучше всего для структурированного контента. Контуры продуктов, лайн-арт, диаграммы, документы и UI-подобные макеты декодируются наиболее надёжно.
- Чётче, чем комьюнити-декодер. В фиксированном наборе из 8 промптов + 2 правок декодер 500K стабильно чётче и связнее на природных деталях, технических диаграммах, деталях продуктов, архитектуре, повторяющихся текстурах и плотных UI. Точный текст остаётся слабым местом: текст на упаковке, подписи диаграмм, вывески и заголовки UI часто неверны.
- Это не видеодекодер. Не используйте его как замену видеоваэ MiniMax H3. Обучение на статичных изображениях контролировало лишь одно временное граничное условие, поэтому на поздних кадрах полной последовательности возможны артефакты сетки или блоков, мерцание, резкие переходы и дрейф текстуры.
Сценарии использования
Предполагаемое применение — декодирование одного временного среза латентного пространства H3 в одно изображение: полезно для просмотра или редактирования латентного пространства H3 как изображения, экспериментов «текст-в-изображение» через замороженный сгенерированный латент или редактирования с условием первого кадра через рабочий процесс FL2VA H3. В README эти пути задокументированы фиксированными предварительно зарегистрированными примерами: реконструкция, T2I H3 через один срез латента, редактирование изображений на основе FL2VA, а также «сложный» набор из восьми промптов T2I и двух правок с условием источника без поиска сида и выбора лучшего кадра.
Поскольку H3 по-прежнему строит и денойзит совместный видео/аудио латент, это существенно дороже специализированного генератора изображений, и авторы рекомендуют перебирать несколько временных срезов для задач редактирования, так как композиция, освещение или материалы могут дрейфовать во время перехода.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.