Kandinsky 6.0: ComfyUI 비디오 및 오디오 생성 모델과 워크플로

ComfyUI Wikinews

ComfyUI용 Kandinsky 6.0 오픈 가중치: 29B Pro와 3B Lite가 동기화된 44 kHz 오디오와 함께 5초 비디오를 생성하고, 슈퍼 해상도로 Full HD까지 지원합니다.

Kandinsky Lab은 10월 6일 Kandinsky 6.0 Video를 오픈소스로 공개했습니다. 동기화된 텍스트-오디오-비디오 생성을 위한 diffusion 모델 제품군입니다. Kandinsky 6.0 Video Pro (29B)와 Kandinsky 6.0 Video Lite (3B)는 모두 립싱크를 포함해 동기화된 44 kHz 오디오가 담긴 5초 클립을 생성하며, 텍스트-오디오-비디오(T2AV)와 이미지-오디오-비디오(TI2AV) 모드를 지원합니다. 별도의 슈퍼 해상도 모델은 출력을 Full HD로 끌어올립니다. ComfyUI 지원은 같은 날 자사 확장으로 제공되며, 바로 실행할 수 있는 워크플로 템플릿 두 개가 포함됩니다.
Kandinsky 6.0 공식 프로모

Kandinsky 6.0 공식 프로모.

Kandinsky 6.0의 새로운 점

Kandinsky 6.0 Video는 사운드트랙을 나중에 입히는 대신 비디오와 오디오를 함께 생성하는 기반 diffusion 모델 제품군입니다. 라인업은 두 가지 크기로 나뉩니다:

  • Kandinsky 6.0 Video Pro: 29B 파라미터, 플래그십 라인.
  • Kandinsky 6.0 Video Lite: 3B 파라미터, 컴팩트 라인.

각 모델은 세 가지 형태로 제공됩니다: 베이스 체크포인트, 빠른 반복 작업을 위한 distilled 10스텝 체크포인트, 그리고 사전 학습된(pretrained) 체크포인트입니다. 모두 24 fps로 5초 클립을 생성하고 대사, 환경음, 음악을 아우르는 동기화된 44 kHz 오디오를 함께 만들며, 두 가지 모드를 지원합니다:

  • 텍스트-오디오-비디오(T2AV): 하나의 텍스트 프롬프트가 클립과 사운드트랙을 생성합니다.
  • 이미지-오디오-비디오(TI2AV): 참조 이미지가 첫 프레임을 결정하고, 프롬프트가 그다음에 일어날 일을 설명합니다.

아키텍처는 멀티모달 비디오 및 오디오 diffusion transformer(Kandinsky6Transformer3DModel)로, 토큰 수준 텍스트 임베딩을 위한 Qwen2.5-VL 텍스트 인코더와 CLIP 풀드 임베딩을 사용하며, 비주얼 쪽에는 Hunyuan Video VAE를, 오디오 쪽에는 MMAudio VAE와 BigVGAN 스타일 보코더를 조합합니다. 스케줄링은 shift = 5.0인 flow matching입니다.

알아두면 좋은 추론 스위치가 두 가지 있습니다. sample_audio=False는 비디오만 생성하고, expand_prompts=True는 Qwen2.5-VL 텍스트 인코더가 인코딩 전에 짧은 요청을 상세한 요청으로 다시 작성하도록 합니다. 지연 시간은 늘어나지만 추가 가중치는 필요하지 않습니다.

Kandinsky 6.0 공식 쇼케이스.

Full HD 슈퍼 해상도

위 예시에서 생성은 480x864로 동작합니다. 두 번째 파이프라인인 Kandinsky6SRPipeline은 이 프레임들을 받아 K-VAE 잠재 공간에서 타일드 diffusion으로 x2, x2.25, x4로 업스케일하고, 겹치는 타일을 Hann 윈도우로 다시 이어 붙입니다. flow-matching 체크포인트는 타일당 4스텝으로 실행되며, distilled VSR 체크포인트는 이를 2스텝으로 줄입니다.

공식 샘플 클립 중 하나.

ComfyUI에서의 Kandinsky 6.0

Kandinsky Lab은 가중치와 함께 자사 ComfyUI 확장을 공개합니다. ComfyUI Registry에서 kandinsky6과 kandinsky6-sr 두 패키지로 설치되며, Python 3.10 이상과 ComfyUI 0.38.0 이상이 필요합니다. 모델 로딩과 오프로딩은 ComfyUI가 직접 처리하므로 코어 패치가 필요하지 않습니다.

이 확장은 **Pro distilled PiFlow (10스텝, CFG=1)**를 기본값으로 하고 I2VA 참조 인물 사진을 사용하는, 바로 실행 가능한 템플릿 두 개를 제공합니다:

Kandinsky 6.0 텍스트-비디오+오디오 템플릿 Kandinsky 6.0 이미지-비디오+오디오 템플릿

함께 제공되는 두 템플릿: 텍스트-비디오+오디오, 이미지-비디오+오디오.

비증류(non-distilled) Pro와 MagCache도 계속 지원되며, MagCache는 distilled 모델에서는 자동으로 우회됩니다. 대사는 비디오 캡션의 <S>와 <E> 마커 사이에 직접 작성하고, 목소리와 기타 소리는 별도의 오디오 캡션에 설명합니다. 두 템플릿 모두 네이티브 Qwen3.5-9B 프롬프트 미화 기능을 포함하며 노드에서 끌 수 있고, SR 확장은 선택 사항이지만 함께 제공되는 워크플로에 필요합니다.

ComfyUI에는 네이티브 통합도 검토 중입니다: Comfy-Org/ComfyUI #16825가 Kandinsky 6.0 오디오-비디오 노드를 코어에 추가합니다. 병합되기 전까지는 위의 레지스트리 확장이 공식 경로입니다.

모델 파일

공식 ComfyUI 워크플로는 대부분의 파일을 Kandinsky Lab 저장소에서 가져오고, 공유 텍스트 인코더와 비디오 VAE는 기존 Comfy-Org 패키지를 재사용합니다:

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   ├── Kandinsky-6.0-Pro-distill-5s-Diffusers/transformer/diffusion_pytorch_model.safetensors
    │   └── Kandinsky-6.0-VSR-distilled2steps-5s-Diffusers/
    ├── 📂 text_encoders/
    │   ├── qwen3.5_9b_bf16.safetensors
    │   └── qwen_2.5_vl_7b.safetensors
    └── 📂 audio_vae/
        ├── v1-44.pth
        └── bigvgan_vocoder/bigvgan_generator.pt

확장의 Download models 버튼은 이 모든 파일과 각 Diffusers 폴더에 필요한 동반 JSON 설정을 올바른 ComfyUI 디렉토리에 자동으로 배치합니다.

사용 가능 여부

가중치는 Hugging Face의 kandinskylab에 공개되어 있으며, 코드와 ComfyUI 확장, 기술 보고서는 kandinskylab/kandinsky-6에서 확인할 수 있습니다. Kandinsky 6.0은 Diffusers(Kandinsky6TI2VAPipeline 및 Kandinsky6SRPipeline), vLLM-Omni, 그리고 Pro distilled 체크포인트를 실행하는 Hugging Face 데모 Space를 통해서도 사용할 수 있습니다.

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Kandinsky 6.0: ComfyUI 비디오 및 오디오 생성 모델과 워크플로 | ComfyUI Wiki