Kandinsky 6.0: ComfyUI 비디오 및 오디오 생성 모델과 워크플로
ComfyUI용 Kandinsky 6.0 오픈 가중치: 29B Pro와 3B Lite가 동기화된 44 kHz 오디오와 함께 5초 비디오를 생성하고, 슈퍼 해상도로 Full HD까지 지원합니다.
Kandinsky 6.0 공식 프로모.
Kandinsky 6.0의 새로운 점
Kandinsky 6.0 Video는 사운드트랙을 나중에 입히는 대신 비디오와 오디오를 함께 생성하는 기반 diffusion 모델 제품군입니다. 라인업은 두 가지 크기로 나뉩니다:
- Kandinsky 6.0 Video Pro: 29B 파라미터, 플래그십 라인.
- Kandinsky 6.0 Video Lite: 3B 파라미터, 컴팩트 라인.
각 모델은 세 가지 형태로 제공됩니다: 베이스 체크포인트, 빠른 반복 작업을 위한 distilled 10스텝 체크포인트, 그리고 사전 학습된(pretrained) 체크포인트입니다. 모두 24 fps로 5초 클립을 생성하고 대사, 환경음, 음악을 아우르는 동기화된 44 kHz 오디오를 함께 만들며, 두 가지 모드를 지원합니다:
- 텍스트-오디오-비디오(T2AV): 하나의 텍스트 프롬프트가 클립과 사운드트랙을 생성합니다.
- 이미지-오디오-비디오(TI2AV): 참조 이미지가 첫 프레임을 결정하고, 프롬프트가 그다음에 일어날 일을 설명합니다.
아키텍처는 멀티모달 비디오 및 오디오 diffusion transformer(Kandinsky6Transformer3DModel)로, 토큰 수준 텍스트 임베딩을 위한 Qwen2.5-VL 텍스트 인코더와 CLIP 풀드 임베딩을 사용하며, 비주얼 쪽에는 Hunyuan Video VAE를, 오디오 쪽에는 MMAudio VAE와 BigVGAN 스타일 보코더를 조합합니다. 스케줄링은 shift = 5.0인 flow matching입니다.
알아두면 좋은 추론 스위치가 두 가지 있습니다. sample_audio=False는 비디오만 생성하고, expand_prompts=True는 Qwen2.5-VL 텍스트 인코더가 인코딩 전에 짧은 요청을 상세한 요청으로 다시 작성하도록 합니다. 지연 시간은 늘어나지만 추가 가중치는 필요하지 않습니다.
Kandinsky 6.0 공식 쇼케이스.
Full HD 슈퍼 해상도
위 예시에서 생성은 480x864로 동작합니다. 두 번째 파이프라인인 Kandinsky6SRPipeline은 이 프레임들을 받아 K-VAE 잠재 공간에서 타일드 diffusion으로 x2, x2.25, x4로 업스케일하고, 겹치는 타일을 Hann 윈도우로 다시 이어 붙입니다. flow-matching 체크포인트는 타일당 4스텝으로 실행되며, distilled VSR 체크포인트는 이를 2스텝으로 줄입니다.
공식 샘플 클립 중 하나.
ComfyUI에서의 Kandinsky 6.0
Kandinsky Lab은 가중치와 함께 자사 ComfyUI 확장을 공개합니다. ComfyUI Registry에서 kandinsky6과 kandinsky6-sr 두 패키지로 설치되며, Python 3.10 이상과 ComfyUI 0.38.0 이상이 필요합니다. 모델 로딩과 오프로딩은 ComfyUI가 직접 처리하므로 코어 패치가 필요하지 않습니다.
이 확장은 **Pro distilled PiFlow (10스텝, CFG=1)**를 기본값으로 하고 I2VA 참조 인물 사진을 사용하는, 바로 실행 가능한 템플릿 두 개를 제공합니다:
함께 제공되는 두 템플릿: 텍스트-비디오+오디오, 이미지-비디오+오디오.
비증류(non-distilled) Pro와 MagCache도 계속 지원되며, MagCache는 distilled 모델에서는 자동으로 우회됩니다. 대사는 비디오 캡션의 <S>와 <E> 마커 사이에 직접 작성하고, 목소리와 기타 소리는 별도의 오디오 캡션에 설명합니다. 두 템플릿 모두 네이티브 Qwen3.5-9B 프롬프트 미화 기능을 포함하며 노드에서 끌 수 있고, SR 확장은 선택 사항이지만 함께 제공되는 워크플로에 필요합니다.
모델 파일
공식 ComfyUI 워크플로는 대부분의 파일을 Kandinsky Lab 저장소에서 가져오고, 공유 텍스트 인코더와 비디오 VAE는 기존 Comfy-Org 패키지를 재사용합니다:
📂 ComfyUI/
└── 📂 models/
├── 📂 diffusion_models/
│ ├── Kandinsky-6.0-Pro-distill-5s-Diffusers/transformer/diffusion_pytorch_model.safetensors
│ └── Kandinsky-6.0-VSR-distilled2steps-5s-Diffusers/
├── 📂 text_encoders/
│ ├── qwen3.5_9b_bf16.safetensors
│ └── qwen_2.5_vl_7b.safetensors
└── 📂 audio_vae/
├── v1-44.pth
└── bigvgan_vocoder/bigvgan_generator.pt확장의 Download models 버튼은 이 모든 파일과 각 Diffusers 폴더에 필요한 동반 JSON 설정을 올바른 ComfyUI 디렉토리에 자동으로 배치합니다.
사용 가능 여부
가중치는 Hugging Face의 kandinskylab에 공개되어 있으며, 코드와 ComfyUI 확장, 기술 보고서는 kandinskylab/kandinsky-6에서 확인할 수 있습니다. Kandinsky 6.0은 Diffusers(Kandinsky6TI2VAPipeline 및 Kandinsky6SRPipeline), vLLM-Omni, 그리고 Pro distilled 체크포인트를 실행하는 Hugging Face 데모 Space를 통해서도 사용할 수 있습니다.
댓글
GitHub로 로그인하고 토론에 참여하세요.