Fizgig v6.5: 커스텀 어댑터로 Qwen Image 2.1 LoRA 학습하기

ComfyUI Wikinews

Fizgig v6.5는 자체 학습 어댑터를 사용한 Qwen Image 2.1 LoRA 및 LoKR 학습, 터보 프리뷰, 새로운 드라이버 시스템을 추가하며, ComfyUI에서 로드되는 LoRA를 저장합니다.

Fizgig v6.5.0은 9월 27일에 출시되어 Qwen Image 2.1을 스튜디오 안에서 학습 가능한 베이스 모델로 만들어 줍니다 (GitHub | 릴리스 노트 | Qwen Image 2.1 가이드). Fizgig는 이미 Flux 2 Klein, Krea 2, MiniMax H3용 LoRA, LoKR, 전체 파인튜닝을 학습합니다. 이번 릴리스는 동일한 도구 세트를 Qwen의 이미지 모델에 제공하며, Qwen Image 2.1은 스튜디오의 새로운 드라이버 시스템을 통해 추가된 첫 번째 모델입니다.

Fizgig LoRA 및 파인튜닝 스튜디오

Fizgig: Flux 2 Klein 9B, Krea 2, MiniMax H3, 그리고 이제 Qwen Image 2.1을 위한 학습, 파인튜닝, 복구, 탐색 워크벤치

Qwen Image 2.1 학습에 포함된 것

  • LoRA 또는 LoKR 학습: Adaptive LR 또는 Automagic, EMA, Context LoRA, 일시 정지 및 재개를 지원합니다.
  • 학습 중 터보 프리뷰: Viggle의 6스텝 터보 LoRA로 구동됩니다. Fizgig는 자체 테스트에서 이 방식이 터보 기본값인 전체 강도 6스텝보다 낫다는 것을 확인한 뒤, 기본적으로 전체 강도 미만인 0.7 강도로 10스텝을 실행합니다.
  • 이미지별 손실 감시: 문제 이미지 감지, 이미지별 학습률, look-outlier 워밍업, 그리고 Captions 탭에서 사용하는 것과 동일한 Qwen3-VL 캡셔너로 정체된 이미지를 자동 재캡셔닝합니다.
  • 실행 중 실시간 샘플 오버라이드 패널.
  • 다섯 가지 워크벤치 도구 전부: Repair Studio, LoRA the Explorer, Profiler, Extract, LoRA Royale.

저장된 LoRA, LoKR, Repair Studio 저장물, Extract 출력은 ComfyUI의 표준 LoRA 로더를 통해 로드됩니다.

Fizgig 자체 학습 어댑터

Qwen 2.1 LoRA는 텍스처로 붕괴하거나 학습 도중 흔들리는 습성이 있고, 손실이 낮다고 해서 그런 일이 벌어지고 있다고 알려주지 않습니다. Fizgig의 해결책은 학습 어댑터입니다. 학습하는 동안 고정된 채 활성 상태로 유지되고, 프리뷰에서는 꺼지며, 저장된 LoRA 안에는 절대 들어가지 않아 결과물이 일반 모델에서도 작동하는 작은 LoRA입니다. 기존 Qwen 2.1 학습 보조 도구보다 더 높은 해상도에서 학습되었으며, 작성자에 따르면 이를 사용해 학습한 LoRA는 붕괴를 피할 뿐 아니라 훨씬 더 선명하게 나온다고 합니다. 모든 Qwen 프리셋에서 기본으로 켜져 있으며, Hugging Face에서 모든 학습자가 사용할 수 있도록 공개되어 있습니다.

세 가지 프리셋, 하나의 최적점

세 프리셋 모두 0.5 MP에서 adamw8bit, EMA 0.98, 학습 어댑터를 사용해 30 에폭 동안 학습하며, 매 에폭마다 저장합니다:

프리셋Rank학습률용도
Qwen 2.1 Fast (기본값)8Adaptive LR 2e-4 ~ 4e-4대부분의 피사체. 작성자의 테스트에서 인물 유사도에 가장 빨리 도달했고 피부 디테일 유지도 가장 뛰어납니다.
Qwen 2.1 Standard16Adaptive LR 1e-4 ~ 2e-4더 크거나 혼합된 데이터셋. Fast 프리셋의 학습률로 Rank 16을 쓰면 과적합됩니다.
Qwen 2.1 Style16고정 1.5e-4스타일. 스타일 데이터셋에서는 Adaptive LR이 계속 상승하는 경향이 있는데, 바로 그 지점에서 스타일이 과하게 구워집니다.

더 빠르게 학습하는 이유는 이렇습니다. Qwen은 기본적으로 매우 선명한 이미지를 렌더링하는데, LoRA는 피부 텍스처 같은 미세 디테일을 데이터셋이 가진 쪽으로 끌어당기므로, 부드러운 사진으로 오래 학습하면 Qwen의 선명도를 그 사진들의 선명도와 맞바꾸게 됩니다. 0.5 MP는 50만 픽셀로, 정사각형 이미지 기준 약 704×704이며, Fizgig는 그 픽셀 수에서 각 이미지를 형태별로 버킷팅합니다. 4:5는 624×784, 2:3은 576×848, 9:16은 528×928입니다. 저장된 에폭은 LoRA Royale에서 계속 훑어볼 수 있으므로, 나중 에폭이 더 부드러워 보인다면 이전 에폭이 더 나은 선택인 경우가 많습니다.

10 GB까지 내려온 그래픽카드

베이스 정밀도와 블록 스왑 크기는 여유 VRAM에 맞춰 자동으로 정해집니다. Auto는 24 GB 이상에서 bf16, 12~16 GB에서 INT8, 10 GB에서 4-bit NF4를 선택하며, 10 GB가 Qwen Image 2.1의 하한입니다. 약 20 GB 미만의 여유 공간에서는 텍스트 인코더가 8비트로 양자화되는데, 이 하한을 결정하는 것이 바로 이 부분입니다. 작성자의 테스트에서 12 GB로 제한한 RTX 5090은 프리뷰를 포함해 9.9 GB 피크로 INT8에서 학습했고, 10 GB로 제한했을 때는 7.3 GB 피크로 NF4에서 학습했습니다.

드라이버 시스템

Qwen Image 2.1은 Fizgig의 새로운 드라이버 시스템을 통해 추가된 첫 번째 모델입니다. 모델을 파일, LoRA 형식, 모델 코드로 표준 인터페이스 뒤에 한 번만 기술하면, 학습, 프리뷰, 다운로드, 메모리 계획, 그리고 다섯 가지 워크벤치 도구 전부가 그 기술을 바탕으로 작동합니다. 이 시스템에 대한 가이드와 더 많은 모델 추가를 위한 공개 풀 리퀘스트가 다음 주에 제공될 예정입니다.

시작하기

Preferences 탭의 Qwen Image 2.1 섹션에서 내 모델 다운로드를 누르면 DiT, VAE, 텍스트 인코더, 학습 어댑터, 터보 LoRA(약 34 GB)를 받아오고, Qwen3-VL 캡셔너가 없다면 그것도 함께 받아옵니다. 그런 다음 Training 탭에서 Base Model로 Qwen Image 2.1을 선택하세요. Qwen Image 2.1용 Edit 학습은 곧 출시 예정으로 안내되어 있습니다.

Fizgig는 ComfyUI 노드가 아니라 독립 실행형 학습 도구입니다. kohya 형식의 .safetensors LoRA를 저장하며, 이 파일은 ComfyUI/models/loras/에 바로 넣으면 됩니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Fizgig v6.5: 커스텀 어댑터로 Qwen Image 2.1 LoRA 학습하기 | ComfyUI Wiki