Qwen-Image 2.1 Fun Acc LoRA: 공식 4스텝 증류

ComfyUI Wikinews

Alibaba PAI가 346MB PDD LoRA로 Qwen-Image 2.1을 4스텝으로 증류했습니다. 텍스트 기반 이미지 생성과 명령 기반 편집을 모두 지원하며 자체 시그마 스케줄을 사용합니다.

Qwen-Image-2.1-Fun-Acc-LoRAs (Hugging Face | VideoX-Fun)는 Qwen-Image 2.1을 위한 Alibaba PAI의 4스텝 가속 어댑터입니다. 346 MB 단일 LoRA가 병렬 디코딩 증류(Parallel Decoding Distillation)를 사용해 텍스트 기반 이미지 생성과 명령 기반 편집을 4 NFE까지 끌어내리며, 저장소에는 샘플러 코드와 증류에 사용된 정확한 시그마 스케줄도 함께 제공됩니다.

이 어댑터는 Alibaba PAI가 지난 8월 MiniMax H3 PDD Acc LoRAs에 사용한 것과 동일한 레시피를 따릅니다. 강력한 베이스 모델을 가져와 병렬 디코딩 증류(PDD, arXiv 2607.26004)로 증류한 뒤, 추출된 LoRA와 참조 결과를 재현하는 데 필요한 추론 코드를 공개하는 방식입니다. Qwen-Image 2.1 자체는 2026년 9월 20일에 출시되어 이미 ComfyUI에서 지원되므로, 이 릴리스는 불과 며칠 된 모델의 가속 변형입니다.

저장소에 포함된 항목

어댑터models/Qwen-Image-2.1-Fun-Acc-4Step.safetensors, 346 MB, rank 64 및 BF16의 network_alpha 64
베이스 모델Qwen-Image 2.1 (Qwen/Qwen-Image-2.1), 가중치 변경 없음
스텝4 NFE (pdd_num_steps: 4, pdd_block_size: 1)
작업텍스트 기반 이미지 생성 및 명령 기반 이미지 편집
학습 대상32개 트랜스포머 블록 전체의 img_in, modulation.1, norm_out.linear, 타임스텝 임베더, attn.to_q/to_k/to_v/to_out.0, img_mlp, 그리고 txt_in.in_layer / txt_in.out_layer
추론 전용 추가 항목어텐션 norm_q / norm_k와 txt_in.text_norm은 LoRA 쌍 대신 전체 파라미터로 저장됩니다
기본 샘플 크기2048 x 2048 (pdd_sample_size)
샘플링 정밀도native_time_fp32_state

시그마 스케줄은 구현 세부 사항이 아니라 릴리스의 일부입니다. pdd_config.json은 4스텝 스케줄을 1.0, 0.9169867, 0.7861579, 0.549491, 0.0으로 고정하며, 내보내기 형식은 qwenimage21_extracted_prefused_v1입니다. 바로 이 숫자들 때문에 이 LoRA는 단순히 그대로 넣어 쓰는 LoRA가 아닙니다. 기본 시그마를 사용하는 일반적인 4스텝 샘플러로는 증류된 동작을 재현할 수 없습니다.

비교

모델 카드는 모든 예시에 대해 세 가지 결과를 비교해 공개합니다. 40 NFE의 teacher, 4 NFE의 PDD LoRA, 4 NFE의 Viggle v0.1 full입니다. PDD는 자체 teacher뿐 아니라 9월 초에 출시된 이 모델의 또 다른 4스텝 경로인 Viggle turbo LoRA와도 비교됩니다.

40 NFE의 Teacher 출력4 NFE의 PDD LoRA 출력4 NFE의 Viggle v0.1
Teacher: 40 NFEPDD LoRA: 4 NFEViggle v0.1 full: 4 NFE

텍스트 기반 이미지 생성 샘플이며 프롬프트는 PDD 논문에서 가져왔습니다. 세 패널 모두 시드 42를 사용합니다.

편집도 동일한 어댑터로 처리되며, 다중 참조 편집도 포함됩니다. 아래 예시는 참조 이미지의 깃발을 다시 그린 것이고, 세 번째 열은 Viggle turbo LoRA로 제공되는 동일한 4스텝 경로입니다.

편집 참조Teacher 편집PDD LoRA 편집Viggle v0.1 편집
참조 이미지Teacher: 40 NFEPDD LoRA: 4 NFEViggle v0.1 full: 4 NFE
Teacher 두 참조 편집PDD LoRA 두 참조 편집Viggle v0.1 두 참조 편집
Teacher: 40 NFEPDD LoRA: 4 NFEViggle v0.1 full: 4 NFE

두 참조 편집 샘플(사람과 고양이), 시드 43.

문서화된 한계

모델 카드는 직접 발견하게 두는 대신 teacher 대비 알려진 두 가지 격차를 명시합니다.

  • 밀집된 작은 텍스트는 눈에 띄게 저하될 수 있으며, 글자 획이 왜곡되고 가독성이 떨어집니다.
  • 일부 편집 출력은 teacher보다 약간 더 흐리고 어둡게 보이며, 세부 묘사의 선명도가 떨어집니다.

사용 가능 여부

공식 ComfyUI 지원은 없으며, 이 릴리스는 공식 파이프라인에 맞춰 작성되었습니다.

  • Diffusers 전용: 번들로 제공되는 qwenimage21_pdd.py와 lora_utils_pdd.py를 스크립트 옆에 두고 python predict_t2i.py(생성) 또는 python predict_t2i_edit.py(편집)를 실행하세요.
  • VideoX-Fun: videox_fun.pipeline에서 QwenImage21Pipeline을 노출하는 체크아웃을 사용하고 predict_t2i_videox_fun.py 또는 predict_t2i_edit_videox_fun.py를 실행하세요.

ComfyUI의 경우 지금까지는 실험적인 경로만 있습니다. Kijai가 ComfyUI 저장소의 Qwen-Image 2.1 PDD 브랜치를 공개했으며, ComfyUI 로더가 사용하려면 LoRA를 변환해야 합니다. 스케줄과 LoRA가 아닌 norm_q / norm_k / text_norm 파라미터가 증류의 일부이므로, 이 어댑터의 ComfyUI 변환은 지원되는 경로가 아니라 커뮤니티 작업으로 취급하세요.

같은 팀이 이전에 공개한 MiniMax H3용 가속 어댑터는 이 계열 릴리스가 작동하는 방식을 보여주는 가장 가까운 참조점입니다. 거기서도 증류된 LoRA는 베이스 모델용 일반 LoRA가 아니라 자체 추론 레시피와 함께 제공되었습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Qwen-Image 2.1 Fun Acc LoRA: 공식 4스텝 증류 | ComfyUI Wiki