AnyAngle: LoRA для Qwen-Image 2.1 с произвольными углами камеры
AnyAngle переводит фото Qwen-Image 2.1 на любой угол камеры: отрендерите сцену из гауссова сплата или 3D-модели, а затем перенесите новый ракурс через модель редактирования.
Изменения угла камеры, задаваемые только промптом, в моделях редактирования обычно сводятся к нескольким фиксированным азимутам и высотам, а при дальнейшем нажиме изображение уходит в другой вид. AnyAngle разделяет задачу: геометрия определяет новую точку обзора, а модель редактирования решает, как исходное изображение должно выглядеть оттуда.
Изменение угла камеры, выполненное с помощью LoRA, из карточки модели.
Pipeline
В карточке модели метод описан как цепочка существующих инструментов, а не как единая модель:
- Реконструируйте сцену. Исходное изображение превращается в гауссов сплат (автор использует Tripo Splat, но отмечает, что подойдёт любой генератор сплатов) или в 3D-модель через Trellis2 либо Pixal3D.
- Переместите камеру в Blender. Импортируйте реконструкцию, добавьте камеру, установите её на нужный угол и отрендерите черновое изображение этого вида.
- Перенесите угол с помощью Qwen-Image 2.1. Подайте черновой рендер и оригинальное изображение в модель редактирования вместе с LoRA AnyAngle и промптом ниже. Выход сохраняет стиль и материалы оригинального изображения, принимая новую точку обзора.
Change the camera angle from <image2> to <image1>.
Трёхшаговый pipeline, как показано на карточке модели: исходное изображение, черновой рендер из нового угла и завершённое редактирование.
Как связаны элементы в графе из карточки модели: оригинальное изображение и черновой рендер оба попадают в pipeline редактирования Qwen-Image 2.1 с применённой LoRA.
Настройки
В карточке точно указано, в каких условиях LoRA работает лучше всего:
- Сила LoRA 1.0.
- CFG 3.0 и 20 шагов или больше для наилучших результатов.
- Turbo LoRA можно добавить поверх, чтобы снизить задержку при раскадровке и планировании кадров, с небольшим снижением качества.
Сам вес представляет собой адаптер ранга 24, около 120 МБ в bf16, а его ключи названы как diffusion_model.*: именно такого именования ожидает собственный загрузчик LoRA в ComfyUI, поэтому он загружается без шага конвертации.
Обучение
Датасет сочетает настоящие рендеры из Blender, выбранные ради стилистического разнообразия, с синтетическими парами: оригинальное изображение плюс соответствующий кадр под другим углом камеры. Поскольку опорное и целевое изображения являются рендерами одной и той же сцены, пары геометрически согласованы, а не сгенерированы, и именно это удерживает стили согласованными при больших изменениях угла. Чтобы охватить стили иллюстраций и скетчей, автор использовал орбитальные рендеры image-to-video от MiniMax H3, где всё в кадре остаётся неподвижным, пока движется камера, а затем обучал модель несколько тысяч шагов.
Где метод ошибается
Результат настолько хорош, насколько качественна реконструкция. Если сплат или 3D-модель пространственно неверны или слишком грубы, объекты могут оказаться не на своих местах, а лица деформироваться на изображениях низкого разрешения. В примерах карточки стол и хвостик оказываются в неправильном взаимном расположении именно по этой причине, а предлагаемые исправления: скорректировать размещение объектов в реконструкции или начать с лучшего сплата, с ожиданием, что новые генераторы 3D и миров будут постоянно улучшать этот шаг.
Доступность
- Веса LoRA, метод и примеры: lilylilith/QI_2.1_AnyAngle
- Базовая модель: Qwen/Qwen-Image-2.1, загружается через официальный рабочий процесс редактирования Qwen Image 2.1 в ComfyUI
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.