Qwen-Image-2.1 Next-Scene LoRA: 연결형 스토리보드

ComfyUI Wikinews

akhaliq의 Next-Scene LoRA는 Qwen-Image 2.1이 단일 프레임에서 다음 연출 샷을 렌더링하고, ComfyUI LoRA 노드를 통해 스토리보드로 이어지도록 학습시킵니다.

Qwen-Image-2.1-Next-Scene-LoRA는 Qwen-Image 2.1에 아주 특정한 편집 하나를 가르치는 rank-64 어댑터입니다. 현재 프레임과 감독 스타일의 지시가 주어지면, 가지고 있는 프레임을 편집하는 대신 다음 샷을 생성합니다. 카메라 무브, 공개(reveal), 조명 변화가 적용되는 동안 세계관과 캐릭터, 스타일은 그대로 유지되며, 출력을 다시 다음 입력으로 넣어 스토리보드를 구축할 수 있습니다.
사진 한 장에서 네 번의 홉, 각 프레임은 이전 프레임에서 생성됨

사진 한 장에서 나온 네 개의 연출 샷. 각 프레임은 이전 출력에 새로운 지시를 붙여 다시 넣은 결과이며, 권장 step-2,500 체크포인트와 strength 0.7을 사용했습니다.

Qwen-Image 2.1에 추가되는 것

next-scene 형식은 lovis93/next-scene-qwen-image-lora-2509에서 왔으며, 이 LoRA는 Qwen-Image 2509 edit 모델에서 313,000회 다운로드를 기록했습니다. 이번 것은 현재 베이스 모델로의 이식판입니다. 즉 아직 이 능력이 없는 Qwen-Image 2.1에서 네이티브로 재학습했습니다. 카메라가 어디에 있는지를 제어하는 akhaliq의 이전 Multiple-Angles LoRA와 짝을 이루는데, Next-Scene은 이야기가 다음에 어디로 가는지를 제어합니다.

프롬프트는 Next Scene:으로 시작하고 카메라 방향을 앞세웁니다. 예를 들어 "Next Scene: The camera pulls back to a sweeping aerial view, revealing the fleet behind the cliffs"처럼 씁니다.

Next Scene: The camera tracks forward and tilts down as rain begins to streak the lens.
Next Scene: Cut to a low-angle shot; sunlight breaks through the clouds behind her.
Next Scene: The camera pans right, revealing the fleet massing behind the ridge.

측정된 레시피로 이어 붙이기

각 출력을 다시 다음 입력으로 넣는 것이 이 어댑터를 스토리보드 도구로 만드는 핵심입니다. 다만 작성자는 실패 모드를 추측하지 않고 직접 측정했습니다. strength 0.9에서의 순진한 체이닝은 3~4번째 홉쯤이면 필름 그레인이 누적되어 눈에 보이는 색상 노이즈가 됩니다. 깨끗한 체인을 위한 검증된 레시피는 strength 0.7 이하와 체인에 들어가는 모든 입력에 0.5픽셀 가우시안 블러 적용이며, 이것이 그레인 증폭 피드백 루프를 끊어줍니다. 위의 네 홉 예시도 정확히 이 방식으로 렌더링했습니다.

첫 번째 홉두 번째 홉
홉 1: 카메라가 뒤로 빠지며 와이드 샷홉 2: 오른쪽으로 팬, 우주비행사가 월면토를 가로질러 도약
세 번째 홉네 번째 홉
홉 3: 우주비행사가 경례하는 로우앵글 샷으로 컷홉 4: 금색 바이저로 푸시 인, 바이저에 비친 달 착륙선

어떤 체크포인트를 쓸까

저장소에는 변환된 체크포인트 세 개와 원본 학습 출력이 함께 들어 있습니다.

체크포인트평가
next_scene_step2500.safetensors권장. 최종 스텝으로, diffusers 키 레이아웃으로 변환되었습니다. 구도와 정체성을 유지하면서 장면 변환이 가장 강력합니다.
next_scene_step1500.safetensors더 부드러운 대안으로, 정체성에 더 완만합니다. 2,500이 너무 강하게 밀어붙인다면 사용하세요.
next_scene_step1000.safetensors변환이 가장 약하며, 주로 학습 곡선을 살펴보는 용도로 유용합니다.
checkpoints/qwen21_next_scene_v1_*.safetensors원본 ai-toolkit 형식입니다. MLP 키가 ai-toolkit의 fused 네이밍을 사용해 diffusers가 조용히 건너뜁니다. ai-toolkit이나 자체 로더를 통해서만 사용할 수 있습니다.

작성자는 또한 폭풍 프롬프트 하나로 step 1,000, 1,500, 2,500에 걸친 체크포인트 스윕을 no-LoRA 컨트롤과 함께 공개했습니다. Qwen-Image 2.1은 자체 편집 성능이 좋기 때문에 베이스 모델도 이미 폭풍을 시도합니다. 하지만 탐험가와 폐허, 색감을 그대로 유지하면서 계곡 위로 완전한 폭풍 전선을 몰아오는 셀은 step 2,500입니다.

no-LoRA 컨트롤과 함께 학습 스텝별 체크포인트 스윕

시네마틱한 시작 이미지 하나, 각 체크포인트에 동일한 폭풍 지시, 그리고 no-LoRA 컨트롤.

학습 방식

  • 베이스: Qwen-Image 2.1, arch: qwen_image_2.
  • 데이터: 장면 진행 쌍 1,144개. Blender 오픈 필름 Sintel과 Tears of Steel(CC-BY)의 연속 프레임을 사용했으며, 각 프레임-다음 프레임 쌍마다 Qwen3-VL-4B가 감독 스타일의 "Next Scene: ..." 지시로 캡션을 달았습니다. 원본 쌍과 캡션이 달린 세트가 모두 공개되어 있습니다.
  • 학습: ostris/ai-toolkit, rank 64 / alpha 64, adamw8bit, 학습률 1e-4, weighted timesteps, caption dropout 0.05, 512픽셀, 2,500 스텝, uint3 양자화된 베이스를 bf16으로 학습.

범위와 한계

이 어댑터는 애니메이션 한 편과 실사 한 편의 시네마틱 필름 프레임으로 학습했습니다. 사진에도 일반화되지만, 영화적인 장면과 풍경, 설정 샷에서 가장 강력하며 정적인 인물 사진은 설계상 범위 밖입니다. 학습은 512픽셀에서 이루어졌고, 더 큰 캔버스는 그 동작을 물려받지만 학습된 적은 없습니다. 250스텝 단위 샘플 그리드는 checkpoints/samples/에 보관되어 있으며, Trackio 대시보드와 데모 Space가 모델 카드에서 링크되어 있습니다.

ComfyUI 사용 가능 여부

권장 체크포인트는 이미 변환되어 있어 모든 Qwen-Image 2.1 워크플로에서 LoRA 노드를 통해 strength 0.7~0.9로 로드할 수 있으며, 이미지는 편집 또는 참조 입력으로 전달합니다. 이 어댑터를 위한 별도의 워크플로 파일은 없으며, ComfyUI에서는 루트 레벨의 next_scene_step*.safetensors 파일을 사용해야 합니다. checkpoints/ 안의 사본은 ai-toolkit 형식입니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Qwen-Image-2.1 Next-Scene LoRA: 연결형 스토리보드 | ComfyUI Wiki