Qwen-Image 2.1 Consistency LoRA: 원본 프레임을 벗어나지 않는 편집

ComfyUI Wikinews

Qwen-Image 2.1용 커뮤니티 LoRA가 편집 결과를 원본 프레임에 고정합니다. 같은 프롬프트와 seed로 드리프트나 원치 않는 재도색 없이 결과를 얻을 수 있으며, 두 가지 ComfyUI 워크플로가 함께 제공됩니다.

Qwen-Image 2.1 Consistency LoRA(Hugging Face)는 편집 결과를 원본 이미지의 프레임에 고정하는 커뮤니티 어댑터입니다. 사진을 수채화나 만화 버전으로 바꿔 달라고 Qwen-Image 2.1에 요청하면, 결과는 보통 몇 퍼센트 더 길어지고 옆으로 밀리며 seed마다 달라집니다. 이 LoRA는 그런 드리프트를 학습으로 제거합니다. 같은 프롬프트, 같은 seed를 쓰면 결과가 소스와 정확히 일치합니다. ausboss는 9월 27일 두 개의 체크포인트, 두 개의 ComfyUI 워크플로, 그리고 그 근거가 된 드리프트 측정값과 함께 가중치를 공개했습니다.
LoRA 없이 수채화로 재스타일하면 그림이 더 길게 그려지고, LoRA를 사용하면 원본 선에 그대로 유지됩니다

점선은 원본에서 특징이 위치한 곳을 표시하고, 화살표는 얼마나 이동했는지 보여줍니다. 모든 열에 같은 프롬프트와 seed를 사용했으며, Comfy-Org INT8 Qwen-Image 2.1 가중치로 ComfyUI에서 렌더링했습니다.

무엇을 해결하는가

Qwen-Image 2.1의 모든 편집은 새로 생성하는 것이므로, 모델은 요청한 부분만 바꾸는 대신 전체 그림을 다시 구성합니다. 전체 재스타일에서는 이것이 드리프트로 나타납니다. 허리 밴드가 40 px 내려가고, 지평선이 25 px 올라가고, 얼굴이 더 이상 원본과 정렬되지 않습니다. 국소 편집에서는 재도색으로 나타나는데, 편집 영역 밖의 머리카락 가닥, 간판, 텍스처까지 함께 다시 그려집니다.

이 LoRA는 편집이 원본의 프레임 위에서 일어나게 합니다. 트리거 단어는 없습니다. 로드하고 평소처럼 편집 지시문을 작성하면, 변경 밖의 픽셀은 원래 자리에 그대로 남습니다.

측정된 드리프트

모델 카드에는 학습 세트에 한 번도 포함되지 않은 홀드아웃 편집에서 나온 수치가 보고되어 있습니다. 오프셋은 원본과 비교해 측정한 그림의 최악 모서리이며, 스타일 열은 각 렌더를 순수 Qwen-Image 2.1의 모습과 비교한 것으로, 거리가 낮을수록 더 가깝게 일치한다는 뜻입니다:

홀드아웃 편집, 순수 Qwen 2.1 vs LoRALoRA 없음1500 스텝2000 스텝
재스타일 (36): 최악 모서리 오차, 중앙값24.3 px1.6 px0.9 px
재스타일: 최악 모서리 오차, 최악의 경우61.1 px12.9 px3.5 px
3 px 미만 오차 재스타일3 %75 %97 %
재스타일 (15): 순수 Qwen 모습 대비 색상 거리7.06.310.9
재조명 및 국소 편집 (12): 최악 모서리 오차, 중앙값0.7 px0.1 px0.1 px

순수 Qwen-Image 2.1의 두 seed는 그 색상 척도에서 서로 7.0만큼 차이가 나므로, 1500 스텝 재스타일은 순수 Qwen이 자기 자신과 닮은 만큼 순수 Qwen과 닮아 있습니다. 2000 스텝은 더 정확하게 정렬되지만 모습이 바뀌기 시작합니다. 종이색이 더 하얘지고 잉크와 과슈에서 색이 줄어듭니다.

두 번째 세트는 드리프트가 아니라 재도색을 측정한 것으로, 홀드아웃 사진에 대한 18개의 색상 변경 및 제거 편집을 사용했습니다. 각 렌더는 먼저 원본과 정렬되므로, 계산되는 것은 오프셋이 아니라 실제 재도색입니다:

순수 Qwen은 머리카락, 상점 간판, 신호등을 다시 그리지만 LoRA는 그대로 남겨두는 거리 모퉁이 색상 변경
편집된 객체 밖 영역LoRA 없음1500 스텝2000 스텝
눈에 띄게 변한 픽셀12.8 %7.5 %7.5 %
원본 대비 PSNR27.7 dB31.6 dB31.7 dB

참고로, Qwen-Image 2.1 VAE를 통과해 이미지를 인코딩하고 디코딩하기만 해도 약 2 %의 픽셀이 37 dB에서 변하므로, 이것이 하한선입니다. 편집 자체는 LoRA 사용 여부와 관계없이 18개 사례 모두에서 여전히 일어났습니다.

만화책 페이지로 렌더링한 거리 모퉁이로, 순수 Qwen은 장면을 늘리지만 LoRA는 제자리에 유지합니다 만화책 페이지로 재스타일한 해안 도로로, 순수 Qwen은 지평선을 올리지만 LoRA는 선 위에 유지합니다

모델 카드에서 가져온, LoRA 사용 여부에 따른 동일 편집의 나란히 비교 실행.

1500 스텝 또는 2000 스텝

파일비고
qwen-image-2.1-consistency.safetensors1500 스텝, 권장 시작점. Qwen 고유의 모습을 유지합니다.
qwen-image-2.1-consistency-2000.safetensors2000 스텝: 가장 정확한 정렬이지만 그림이 조금 더 옅게 나옵니다.

둘 다 rank 32이며 ComfyUI 키 이름 지정 방식(diffusion_model.transformer_blocks.*)을 사용하고, 384개의 텐서 모두가 Comfy-Org Qwen-Image 2.1 가중치에 로드됩니다.

ComfyUI에서 실행하기

이 어댑터는 모델 전용 LoRA이므로 커스텀 노드가 필요하지 않습니다. 모든 Qwen-Image 2.1 편집 그래프에 추가하려면:

  1. .safetensors 파일을 ComfyUI/models/loras/에 넣고 모델 로더 바로 뒤에 LoraLoaderModelOnly 노드를 strength 1.0으로 추가합니다. strength를 낮추면 드리프트가 일부 다시 나타납니다.
  2. Text Encode Qwen Image 2.1 노드를 사용하고, 사진을 image_1로, resolution을 0으로, 편집 지시문을 프롬프트로 설정합니다.
  3. 인코더의 latent 출력에서 KSampler로 25 스텝, CFG 1, euler와 simple, denoise 1로 샘플링합니다. 다른 크기의 잠재 데이터를 쓰면 Qwen이 크기 비율만큼 확대하는데, 어떤 LoRA도 이를 되돌릴 수 없습니다.
  4. Qwen-Image 2.1 VAE는 RGBA로 디코드하므로 VAE Decode 후 Split Image with Alpha로 처리합니다.

이 수치들이 나온 것은 이 팩의 Qwen-Image 2.1 Edit 예제 그래프입니다. 저장소에는 바로 사용할 수 있는 두 개의 워크플로가 함께 제공됩니다:

두 번째 워크플로는 LoRA를 끄고 대신 Realign to Source 노드로 완료된 편집을 원본에 다시 정렬하는데, 무언가를 움직여야 하는 편집에는 이 방법이 더 낫습니다. 둘 다 작성자의 ComfyUI-AusBoss 노드로 만들었지만, 모델 카드에는 동등한 노드라면 무엇이든 괜찮다고 적혀 있습니다.

학습 방법

데이터셋은 실제 Qwen-Image 2.1 편집으로 구성되었으며, 모든 학습 예제가 소스의 프레임 위에 놓이도록 각 대상에서 드리프트를 측정해 제거했습니다:

  • 257개 사진에서 추출한 950개 편집 쌍: 이 데이터셋을 위해 Qwen-Image 2.1로 렌더링한 인물 사진 110개, Unsplash 사진 133개, 작성자의 참조 폴더에서 직접 고른 사진 14개.
  • 쌍 유형: 정방향 쌍(사진에서 편집으로), 역방향 쌍(편집에서 사진으로), 그리고 편집된 객체 밖의 모든 곳에서 원본의 픽셀을 유지하는 국소 편집.
  • 학습: ostris/ai-toolkit을 Comfy-Org INT8 ConvRot 베이스에 arch: qwen_image_2로 사용했고, 참조는 대상의 크기로 유지했습니다. Rank 32, alpha 32, AdamW8bit, lr 1e-4, 배치 1, shift 타임스텝, 대상 해상도 1408. H100 한 대에서 3,000 스텝은 스텝당 약 1.9초가 걸렸고, 250 스텝마다 체크포인트를 저장했습니다.

한계

모델 카드는 이 릴리스가 얼마나 좁은 범위인지 솔직하게 밝히고 있습니다. 9월 28일 업데이트에서 작성자는 데이터셋이 특정 종류의 편집에 LoRA를 과적합시켰을 수 있으며, 새로운 포즈나 돌린 머리처럼 실제 움직임이 필요한 요청은 무시할 수 있다고 씁니다. 새 데이터셋이 준비되면 v2가 계획되어 있고, 그때까지는 그러한 편집에는 재정렬 워크플로가 권장 경로입니다.

그 밖에 명시된 한계:

  • 4 또는 8 스텝 turbo LoRA, 2 MP, CFG 1 초과 설정에서는 아직 테스트되지 않았습니다.
  • 만화와 애니메이션 재스타일은 모든 윤곽선을 다시 그리므로, 일부 형태는 스스로 몇 픽셀씩 움직일 수 있습니다. 1500 스텝에서 최악의 재스타일은 모서리에서 12.9 px 벗어났습니다.
  • 이 LoRA는 그림을 제자리에 유지합니다. 약한 편집을 강하게 만들어 주지는 않습니다. 순수 Qwen이 편집을 전혀 하지 않는다면, LoRA도 그것을 바꾸지 못합니다.

사용 가능 여부

qwen-image-2.1-consistency.safetensors 다운로드 (152 MB)

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Qwen-Image 2.1 Consistency LoRA: 원본 프레임을 벗어나지 않는 편집 | ComfyUI Wiki