Turbo8: Qwen-Image 2.1용 8스텝 증류 LoRA

ComfyUI Wikinews

Turbo8은 Qwen-Image 2.1을 CFG 없이 8스텝으로 증류한 LoRA로, 텍스트 기반 이미지 생성, 편집, RGBA 출력과 피사체 추출을 지원하며 두 가지 ComfyUI 워크플로를 제공합니다.

Turbo8(Hugging Face)은 Qwen-Image 2.1용 스텝 증류 LoRA로, CFG 1에서 8스텝으로 렌더링합니다. 이는 베이스 모델의 40회 패스 중 약 5분의 1에 해당합니다. 1.36 GB 단일 파일 하나로 텍스트 기반 이미지 생성, 텍스트 렌더링, 최대 10개의 참조 이미지를 사용하는 지시문 편집, 투명(RGBA) 생성 및 피사체 추출을 모두 처리하며, 저장소에는 바로 사용할 수 있는 ComfyUI 워크플로 두 개가 포함되어 있습니다.

Qwen-Image 2.1은 2026년 9월 20일 출시된 이후 여러 소수 스텝 경로를 끌어들였습니다. Pruna 5스텝 및 8스텝 LoRA, Viggle turbo LoRA, 그리고 Alibaba PAI의 공식 4스텝 Fun Acc 증류가 그 예입니다. Turbo8은 같은 경쟁에 뛰어든 커뮤니티 결과물이며, 차별점은 범위에 있습니다. 텍스트 기반 이미지 생성만 가속하는 대신, 이전 어댑터들이 상대적으로 잘 다루지 못했던 RGBA 및 다중 참조 편집 경로를 포함해 베이스 모델 전체의 동작을 유지하도록 학습되었습니다.

Turbo8로 8스텝, CFG 1에서 생성한 샘플

모든 샘플은 1024²에서 Turbo8, 8스텝, CFG 1, 첫 번째 시드로 생성했으며 프롬프트 내에서 선별하지 않았습니다. 프롬프트는 홀드아웃 평가 세트에서 표시용으로 선택했습니다. 출처: Turbo8-LoRA-Qwen-Image-2.1.

무엇을 하는가

이 어댑터는 Qwen-Image 2.1의 어텐션, MLP, 모듈레이션 및 타임스텝 임베딩 레이어에 적용된 rank-128 LoRA로, 베이스 가중치는 그대로 유지되도록 증류되었습니다. 추론 시에는 **8스텝, CFG 1, 샘플러 euler, 스케줄러 simple**로 실행되며, 작성자는 8스텝을 초과하거나 CFG 1을 넘겨도 결과가 개선되지 않는다고 밝힙니다.

이 LoRA의 목표는 단일 작업이 아니라 폭넓은 커버리지입니다. 모델의 기본 2K 해상도까지의 텍스트 기반 이미지 생성, 영어 및 중국어 텍스트 렌더링, 최대 10개의 참조 이미지를 사용하는 지시문 편집, 투명 생성, 그리고 피사체 추출(사진을 입력해 RGBA 컷아웃을 요청)을 지원합니다. 모델 카드에는 세 단계로 구성된 학습 경로도 문서화되어 있습니다. 먼저 학생 모델의 8개 노이즈 레벨에서 기록한 3,100개의 고정 노이즈 40스텝 교사 렌더링, 그다음 3,000스텝의 궤적 회귀, 마지막으로 fake-score critic과 GAN 헤드를 사용한 2,500스텝의 DMD2 분포 매칭입니다. critic은 동일하게 동결된 transformer 위에 올린 두 번째 LoRA입니다.

ComfyUI에서 실행하기

Turbo8은 ComfyUI의 네이티브 Qwen-Image 2.1 지원을 직접 겨냥합니다.

  1. turbo8_lora_step2500.safetensors 파일을 ComfyUI/models/loras/에 넣습니다.
  2. comfyui/turbo8_t2i.json(텍스트 기반 이미지 생성 및 RGBA) 또는 comfyui/turbo8_edit.json(편집 및 추출)을 불러옵니다.
  3. **스텝 8, CFG 1, 샘플러 euler, 스케줄러 simple**을 유지합니다.

T2I 그래프에는 너비와 높이에 연결된 ModelSamplingFlux 노드(max_shift 0.6935, base_shift 0.5)가 포함되어 있으며, 이는 2K를 포함해 LoRA가 증류된 해상도 의존적 노이즈 스케줄을 재현합니다. 모델 카드에 따르면 227개의 LoRA 레이어가 모두 ComfyUI에서 매핑되며, RTX PRO 6000에서 1024² 이미지 한 장에 약 4초가 걸립니다.

교사 모델과의 비교

모델 카드는 192개의 홀드아웃 프롬프트(DrawBench와 추가 시드, 텍스트 렌더링 프롬프트, RGBA 피사체, OmniEdit 편집 및 추출)를 사용해 Turbo8을 자체 교사 모델인 40스텝 베이스 모델과 평가합니다.

지표교사 (40스텝)Turbo8 (8스텝)
PickScore, T2I22.1521.94
CLIPScore, T2I26.8926.89
PickScore, RGBA20.5120.07
텍스트 정확 일치 (OCR)95.0%75.0%
텍스트 문자 정확도99.6%95.3%
투명도 비율 (RGBA + 추출)0.8750.925
시드 다양성 (낮을수록 다양함)0.7050.670
교사 모델과의 편집 유사도 (DINOv2)n/a0.967
교사 모델 대비 추출 알파 IoUn/a0.85
40스텝의 교사 모델과 8스텝의 Turbo8, 동일 시드

40스텝의 교사 모델(각 쌍의 위쪽 행)과 8스텝의 Turbo8(아래쪽 행), 동일 시드. 샘플은 텍스트 기반 이미지 생성, 텍스트 렌더링, 편집, RGBA 및 추출을 아우릅니다.

문서화된 한계

모델 카드는 사용자가 직접 발견하게 두는 대신 격차를 명시합니다.

  • 밀집하거나 긴 텍스트(문단, 작은 글씨)는 40스텝보다 훨씬 크게 저하되지만, 짧은 헤드라인, 표지판, 라벨은 여전히 안정적입니다.
  • 일부 복잡한 장면에서는 동일 시드에서도 구도가 교사 모델과 달라질 수 있습니다.
  • 추출은 베이스 모델의 실패 사례를 물려받습니다. 평가에서 16개 추출 중 3개가 교사 모델과 Turbo8 모두 빈 결과로 나왔으며, Turbo8은 컷아웃에 주변 맥락을 더 많이 남기는 경우가 있습니다.

커뮤니티 반응

Banodoco의 #qwen-image 채널에서 사용자들은 이후 며칠 동안 이전 소수 스텝 경로들과 Turbo8을 비교 테스트했습니다. 공통적인 발견은 편집에서 성능을 유지하려면 강도를 낮추고 8스텝보다 더 많은 스텝이 필요하다는 것이었습니다. 신체 아티팩트가 나타나기 전까지 강도 0.65, 약 16스텝이 적절하다는 보고가 모였고, 여러 사용자는 편집에서는 6스텝 Viggle turbo보다 Turbo8을 높게 평가하면서도 일부 작업에서는 여전히 Pruna의 8스텝 스케줄을 선호했습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Turbo8: Qwen-Image 2.1용 8스텝 증류 LoRA | ComfyUI Wiki