Qwen-Image-2.1 Next-Scene LoRA: связанные раскадровки

ComfyUI Wikinews

Next-Scene LoRA от akhaliq учит Qwen-Image 2.1 генерировать следующий режиссёрский кадр из одного изображения и связывать кадры в раскадровку через ноду LoRA в ComfyUI.

Qwen-Image-2.1-Next-Scene-LoRA это адаптер ранга 64, который учит Qwen-Image 2.1 одному конкретному действию: получив текущий кадр и инструкцию в стиле режиссёра, генерировать следующий кадр, а не редактировать уже имеющийся. Движения камеры, раскрытия и изменения освещения применяются, а мир, персонажи и стиль остаются на месте; выход можно подать обратно на вход, чтобы построить раскадровку.
Четыре перехода от одной фотографии, каждый кадр сгенерирован из предыдущего

Четыре режиссёрских кадра из одной фотографии. Каждый кадр это предыдущий выход, поданный обратно с новой инструкцией, на рекомендуемом чекпойнте step-2,500 и силе 0.7.

Что это добавляет к Qwen-Image 2.1

Формат next-scene происходит из lovis93/next-scene-qwen-image-lora-2509, который набрал 313 000 загрузок на модели редактирования Qwen-Image 2509. Это порт на текущую базу: переобученный нативно на Qwen-Image 2.1, где такой возможности пока нет. Он дополняет более ранний Multiple-Angles LoRA от akhaliq, который управляет положением камеры, тогда как Next-Scene управляет тем, куда история движется дальше.

Промпты начинаются с Next Scene: и ведут с указания движения камеры, например «Next Scene: The camera pulls back to a sweeping aerial view, revealing the fleet behind the cliffs»:

Next Scene: The camera tracks forward and tilts down as rain begins to streak the lens.
Next Scene: Cut to a low-angle shot; sunlight breaks through the clouds behind her.
Next Scene: The camera pans right, revealing the fleet massing behind the ridge.

Связывание с проверенным рецептом

Именно подача каждого выхода обратно в качестве следующего входа превращает адаптер в инструмент для раскадровок, но автор не стал угадывать режим отказа, а измерил его: наивное связывание при силе 0.9 накапливает плёночное зерно, пока оно не становится заметным цветовым шумом к 3-му или 4-му переходу. Проверенный рецепт чистых цепочек: сила 0.7 или ниже плюс гауссово размытие 0.5 пикселя на каждом входе цепочки, что разрывает петлю усиления зерна. Пример с четырьмя переходами выше был отрисован именно так.

Первый переходВторой переход
Переход 1: камера отъезжает назад, общий планПереход 2: панорама вправо, астронавт скачет по реголиту
Третий переходЧетвёртый переход
Переход 3: склейка на нижний ракурс, астронавт отдаёт честьПереход 4: наезд на золотое забрало, в котором отражается лунный модуль

Какой чекпойнт использовать

В репозитории есть три сконвертированных чекпойнта плюс сырые результаты обучения:

ЧекпойнтВердикт
next_scene_step2500.safetensorsРЕКОМЕНДУЕТСЯ. Финальный шаг, сконвертированный в раскладку ключей diffusers. Самое сильное преобразование сцены при сохранении композиции и идентичности.
next_scene_step1500.safetensorsБолее мягкая альтернатива, бережнее к идентичности. Используйте, если 2,500 давит слишком сильно.
next_scene_step1000.safetensorsСамое слабое преобразование, в основном полезно для изучения кривой обучения.
checkpoints/qwen21_next_scene_v1_*.safetensorsСырой формат ai-toolkit. Ключи MLP используют объединённое именование ai-toolkit, которое diffusers молча пропускает. Использовать можно только через ai-toolkit или его собственный загрузчик.

Автор также опубликовал сравнение чекпойнтов на одном промпте со штормом для шагов 1 000, 1 500 и 2 500 вместе с контролем без LoRA. Базовая модель уже пытается изобразить шторм, поскольку Qwen-Image 2.1 хорошо редактирует сама по себе, но именно на шаге 2 500 полный грозовой фронт прокатывается над долиной, при этом исследователь, руины и палитра остаются нетронутыми.

Сравнение чекпойнтов по шагам обучения с контролем без LoRA

Один кинематографичный стартовый кадр, одна и та же инструкция про шторм на каждом чекпойнте, плюс контроль без LoRA.

Как он обучался

  • База: Qwen-Image 2.1, arch: qwen_image_2.
  • Данные: 1 144 пары последовательности сцен, последовательные кадры из открытых фильмов Blender Sintel и Tears of Steel (CC-BY), подписанные инструкциями в стиле режиссёра «Next Scene: ...» с помощью Qwen3-VL-4B для каждой пары «кадр к следующему кадру». Опубликованы как сырые пары, так и набор с подписями.
  • Обучение: ostris/ai-toolkit, ранг 64 / альфа 64, adamw8bit, скорость обучения 1e-4, взвешенные временные шаги, caption dropout 0.05, 512 пикселей, 2 500 шагов, на базе с квантованием uint3 в bf16.

Область применения и ограничения

Адаптер обучался на кинематографичных кадрах из фильмов, один анимационный и один игровой. Он обобщается на фотографии, но сильнее всего работает на кинематографичных сценах, пейзажах и общих планах, а статичные портреты по замыслу вне области применения. Обучение проводилось на 512 пикселях; большие холсты наследуют поведение, но на них обучение не велось. Сетки примеров каждые 250 шагов хранятся в checkpoints/samples/, а панель управления Trackio и демо Space привязаны из карточки модели.

Доступность в ComfyUI

Рекомендуемый чекпойнт уже сконвертирован, поэтому он загружается в любом рабочем процессе Qwen-Image 2.1 через ноду LoRA при силе от 0.7 до 0.9, а изображение подаётся как вход редактирования или референс. Отдельного файла рабочего процесса для адаптера нет, и именно файлы next_scene_step*.safetensors в корне следует использовать в ComfyUI; копии в checkpoints/ имеют формат ai-toolkit.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Qwen-Image-2.1 Next-Scene LoRA: связанные раскадровки | ComfyUI Wiki