MiniMax H3 360 Orbit LoRA для ComfyUI: одно фото, полный оборот
LoRA от сообщества для MiniMax H3 FL2VA превращает одно фото в 360-градусный облёт камерой, который возвращается к первому кадру, плюс настройки для ComfyUI.
Четыре отдельные орбиты, каждая сгенерирована из одного фото, использованного как начальный и конечный ключевой кадр. Источник: MiniMax-H3-360-Orbit-LoRA.
Что делает LoRA
У MiniMax H3 есть два пути генерации видео, и пробел между ними как раз заполняет этот адаптер. Reference-to-video относится к входным изображениям как к свободным референсам внешнего вида, поэтому клип не заканчивается на известном кадре, и два клипа нельзя аккуратно соединить. Генерация по начальному и конечному кадру закрепляет оба конца, что делает стыки точными, но по умолчанию она почти не даёт движения, когда начальный и конечный кадры совпадают, потому что модель воспринимает запрос как статичное изображение.
Вместо этого адаптер обучает модель настоящей, геометрически согласованной орбите. Сцена объявляется замороженной, путешествует только камера, а поскольку конечный кадр закреплён за начальным, движение замыкается в петлю.
Орбита, отрендеренная из одного фото, где то же изображение использовано как начальный и конечный ключевой кадр.
Сравнение с базовой моделью
В каждом сравнении ниже один и тот же вход отрендерен три раза с одинаковым seed, промптом, разрешением и числом шагов. Слева направо: базовая модель только с начальным кадром, базовая модель с начальным и конечным кадром и базовая модель плюс эта LoRA с начальным и конечным кадром.
Сцена со скейтбордистом: базовая модель либо уходит от начального ракурса, либо застывает, тогда как LoRA завершает орбиту и возвращается к первому кадру.
То же трёхстороннее сравнение вокруг стоящей фигуры.
MP4 в полном разрешении для трёхстороннего сравнения выше.
Только LoRA, без панелей базовой модели рядом.
Промпт
Автор просит использовать этот промпт дословно:
One frozen instant. Only the camera moves. In a continuous 360 orbit. Preserve every person and object in exactly the same world position, orientation, shape and pose throughout the shot. Airborne objects remain suspended at the captured height and angle: no wobbling, shaking, spinning, drifting, falling or continued action. Keep faces, hands, clothing, liquids and the background motionless while retaining their natural appearance. Camera parallax is the only source of apparent movement. No cuts, zoom, morphing or added objects.Рекомендуемые настройки
| параметр | значение |
|---|---|
| базовые веса | MiniMax H3 FL2VA pruned, перепакованная INT8 ConvRot версия из Comfy-Org/MiniMax-H3 |
| ключевые кадры | одно и то же изображение как начальный и конечный кадр, для полной 360-градусной петли |
| разрешение | 768 × 768 |
| кадры | 73 (около 3 с при 24 fps) |
| шаги | 28 |
| guidance | нет. MiniMax H3 дистиллирована по guidance, поэтому здесь нет CFG и нет негативного промпта |
| сила LoRA | 1.0 |
| аудио | выкл. |
Запуск в ComfyUI
Этот адаптер представляет собой единственную LoRA только для модели с именами в стиле ComfyUI (ключи diffusion_model.*), поэтому пользовательские ноды не требуются:
- Скачайте
minimax_h3_flf2v_lora_v1.safetensorsвComfyUI/models/loras/. - Откройте рабочий процесс MiniMax H3 с начальным и конечным кадром и укажите в нём pruned INT8 базу FL2VA вместе с её текстовым энкодером и видео- и аудио-VAE H3.
- Примените LoRA с силой 1.0 через загрузчик LoRA только для модели.
- Загрузите одно изображение в оба слота ключевых кадров и вставьте промпт выше без изменений.
В карточке модели отмечено, что LoRA обучалась и тестировалась с помощью ostris/ai-toolkit и его расширения minimax_h3, а адаптер для обучения, использовавшийся во время тренировки, на этапе вывода не нужен.
Как проходило обучение
Датасет намеренно однообразен. Каждый клип показывает только то движение, которому должна научиться LoRA, и ничего больше, поэтому модель ни разу не видит движения объекта:
- 28 рендеров орбиты вокруг отобранных вручную гауссовых сплатов человека. Поскольку сплаты представляют собой статичные 3D-сцены, каждый кадр геометрически согласован по построению, а между кадрами меняется только камера.
- Формат клипа: 768 × 768, 73 кадра, 24 fps, одна подпись для всех клипов (промпт выше), caption dropout 0.05, без аудио.
- Адаптер: rank 16, alpha 16, применяется ко всем линейным слоям трансформера, кроме
adaln_proj, всего 208 модулей. - Обучение: 3000 шагов (около 107 эпох), размер пакета 1, AdamW 8-bit с lr 1e-4, bf16 с gradient checkpointing, flow-matching со сдвинутыми таймстепами, MSE loss. Одна NVIDIA A100 80 ГБ работала 10 ч 24 мин, примерно 12,5 с на шаг.
Ограничения
Автор прямо говорит о том, насколько узок этот релиз:
- Узкая область применения. В обучении использовались 28 квадратных клипов по 73 кадра с людьми в центре. Другие объекты, другие соотношения сторон и другая длина клипов не тестировались.
- Небольшие движения могут сохраняться. Некоторые тонкие движения, в частности моргание, всё ещё могут появляться, хотя сцена должна быть заморожена.
Доступность
- Веса LoRA: pablodawson/MiniMax-H3-360-Orbit-LoRA
- Перепаковка базовой модели: Comfy-Org/MiniMax-H3
- Инструмент для обучения: ostris/ai-toolkit
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.