Qwen-Video-Edit: 텍스트 기반 영상 편집, ComfyUI 노드 지원

ComfyUI Wikinews

Qwen-Video-Edit는 Qwen-Image-Edit의 DiT를 재활용해 Wan 2.1 비디오 잠재 공간을 텍스트 지시로 직접 편집하는 모델로, 공식 ComfyUI 커스텀 노드와 360P/480P/720P 체크포인트를 제공합니다.

Qwen-Video-EditQwen-Image-Edit의 DiT를 재활용해 Wan 2.1 비디오 VAE 잠재 공간을 직접 편집하는 지시 기반 영상 편집 모델로, 비디오 사전 학습 Transformer가 필요 없습니다. 첫 릴리스는 8월 14일(코드, 논문, 360P 체크포인트)이었고, 8월 20일 공식 ComfyUI 지원과 480P·720P 체크포인트가 추가되었습니다.

이 작업은 Yunpeng Bai(UT Austin), Yossi Gandelsman, Michaël Gharbi(Adobe), Qixing Huang(UT Austin)이 수행했으며, 논문과 전후 비교 데모가 가득한 프로젝트 페이지가 공개되어 있습니다.

장편 영상 편집 데모

다양한 지시로 청크 단위로 편집한 장편 영상 데모: 왼쪽이 원본, 오른쪽이 편집 결과.

작동 방식

Qwen-Video-Edit는 비디오 확산 Transformer를 개조하는 대신, 이미지 편집 모델이 비디오 잠재 공간을 직접 다루도록 합니다.

  • 웜스타트 프로젝션 — 두 개의 작은 학습 가능한 프로젝션이 Wan 2.1의 16채널 비디오 잠재 표현을 DiT 토큰 공간으로 연결하며, DiT 자체의 입출력 레이어에서 초기화되어 정적 영상이 Qwen 이미지와 동일하게 임베딩됩니다
  • 그리드 위치 인코딩 — 잠재 프레임을 하나의 가상 대형 이미지 타일로 배치해 이미지 모델의 사전 분포에 맞춥니다
  • 프롬프트 + 프레임 그리드 프리뷰 — Qwen2.5-VL 브랜치가 소스 프레임 프리뷰와 함께 지시를 인코딩합니다

동결된 Wan 2.1 VAE가 인코딩과 디코딩을 담당하며, 선택적인 Wan 2.2 노이즈 제거 강화 단계(Ditto 기반)가 편집된 잠재 공간을 정리합니다.

"영상을 파스텔톤 동화책 일러스트로 변환해 줘" — 프로젝트 페이지 갤러리의 편집 결과.

ComfyUI 노드

이 저장소는 ComfyUI 커스텀 노드 팩을 겸하며, QwenVideoEdit 카테고리에 3개의 노드를 제공합니다(한 번의 샘플러 호출이 하나의 num_frames 창을 편집하는 싱글 청크 방식).

노드역할
Qwen-Video-Edit LoaderDiT, 텍스트 인코더, VAE, 파인튜닝 체크포인트 로드
Qwen-Video-Edit Sampler (one chunk)프레임 청크 편집: prompt, num_frames, max_pixels, steps, cfg_scale, seed
Wan2.2 Enhance (Ditto)필수 노이즈 제거 강화 노드, wan22_ckpt_dir 설정
Qwen-Video-Edit ComfyUI 워크플로우 데모

체크포인트

모든 파인튜닝 체크포인트는 Hugging Face에 있으며, 추천 체크포인트는 ModelScope에도 미러링되어 있습니다. 디렉터리 이름은 학습 서브셋(Ditto-1M)과 지원 프레임 수를 나타냅니다.

체크포인트학습 데이터프레임 수최대 픽셀
360P/step-30000global + local45245760
480P/global_45/step-6000global45399360
480P/local_45/step-11000local45399360
480P/sim2real_45/step-7000sim2real45399360
480P/global_local_81/step-6500global + local81399360
720P/global_local_45/step-3500global + local45921600

"장면을 디지털 수묵화로 변환해 줘" — 프로젝트 페이지 갤러리의 편집 결과.

사용 방법

Qwen-Video-Edit는 ComfyUI 커스텀 노드 팩으로 제공됩니다. yunpeng1998/Qwen-Video-EditComfyUI/custom_nodes/에 클론하고 의존성과 ComfyUI-VideoHelperSuite를 설치한 뒤 예제 워크플로우(comfyui_workflows/qwen_video_edit_chunk.json)를 로드하면 됩니다. 첫 실행 시 약 55GB의 베이스 가중치(Qwen-Image-Edit DiT, 텍스트 인코더, Wan 2.1 VAE)가 다운로드되며, Wan2.2 강화 단계에는 Wan-AI/Wan2.2-T2V-A14B가 추가로 필요합니다. 체크포인트의 latent_mode / pe_mode / zero_cond_t 설정은 로드하는 체크포인트와 일치해야 합니다. 추천 체크포인트는 ModelScope 미러에서 받을 수 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Qwen-Video-Edit: 텍스트 기반 영상 편집, ComfyUI 노드 지원 | ComfyUI Wiki