Kandinsky 6.0: configuración en ComfyUI y guía de modelos
Ejecuta Kandinsky 6.0 en ComfyUI: Pro de 29B y Lite de 3B generan vídeo de 5 segundos con audio sincronizado a 44 kHz, además de un modelo de superresolución para Full HD.
Kandinsky 6.0
Video GenerationAudio-VideoText-to-VideoImage-to-VideoComfyUIKandinsky 6.0 Video es una familia de modelos de difusión fundacionales para la generación sincronizada de texto a audio y vídeo. Pro (29B) y Lite (3B) producen clips de 5 segundos con audio sincronizado a 44 kHz, incluido el lip-sync, en modos de texto a audio-vídeo e imagen a audio-vídeo, y un modelo de superresolución independiente eleva la salida a Full HD.
| Desarrollador | Kandinsky Lab |
| Fecha de lanzamiento | 2026-10-06 (pesos abiertos) |
| Arquitectura | Transformer de difusión multimodal de vídeo y audio con flow matching (Pro de 29B, Lite de 3B) |
| Codificador de texto | Qwen2.5-VL con un embedding agrupado de CLIP |
| Audio | VAE de MMAudio y vocoder estilo BigVGAN, salida sincronizada a 44 kHz |
| Salida | Clips de 5 segundos a 24 fps, hasta Full HD después de la superresolución |
| Modos de generación | Texto a audio-vídeo, imagen a audio-vídeo |
| Licencia | MIT |
Kandinsky 6.0 Video genera la imagen y la banda sonora juntas en una sola pasada, en lugar de doblar el audio a posteriori. Un transformer de difusión multimodal de vídeo y audio modela ambas señales, con un codificador de texto Qwen2.5-VL que aporta embeddings de texto a nivel de token y un modelo CLIP que aporta un embedding agrupado. El lado visual decodifica mediante un VAE de Hunyuan Video, y el lado de audio ejecuta un VAE de MMAudio más un vocoder estilo BigVGAN para obtener una onda de salida a 44 kHz. El muestreo utiliza flow matching con shift = 5.0.
Modelos
La familia se distribuye en dos tamaños, cada uno con un checkpoint base, uno destilado de 10 pasos y uno preentrenado, además de un par dedicado de superresolución:
| Checkpoint | Tamaño | Notas |
|---|---|---|
| Kandinsky 6.0 Pro | 29B | Checkpoint de generación insignia |
| Kandinsky 6.0 Pro distill | 29B | Destilado a 10 pasos con PiFlow, usado por defecto en las plantillas de ComfyUI |
| Kandinsky 6.0 Pro pretrain | 29B | Base preentrenada para fine-tuning |
| Kandinsky 6.0 Lite | 3B | Checkpoint de generación compacto |
| Kandinsky 6.0 Lite distill | 3B | Variante destilada de 10 pasos |
| Kandinsky 6.0 Lite pretrain | 3B | Base preentrenada para fine-tuning |
| Kandinsky 6.0 VSR | - | Pipeline de superresolución, x2, x2.25 y x4, 4 pasos por mosaico |
| Kandinsky 6.0 VSR distill | - | Superresolución destilada, 2 pasos por mosaico |
Superresolución
Kandinsky6SRPipeline aumenta la resolución de los fotogramas generados con difusión por mosaicos en el espacio latente de K-VAE y combina los mosaicos superpuestos con ventanas de Hann. resolution_scale acepta 2, 2.25 (la ruta predeterminada después de la generación) o 4, y min_overlap y tiles_batch_size intercambian la combinación de mosaicos y la VRAM por velocidad.
ComfyUI
La extensión oficial de ComfyUI la publica kandinskylab en el ComfyUI Registry como kandinsky6 y kandinsky6-sr. Instala ambas a través del Administrador de ComfyUI, reinicia y abre Workflow → Explorar plantillas → kandinsky6 para acceder a las plantillas incluidas Text to Video+Audio e Image to Video+Audio. Los archivos de modelo, incluidos los JSON de configuración de Diffusers que los acompañan, se descargan con el botón Download models de la extensión en las carpetas correctas de ComfyUI.
Recursos
Guides and workflows related to this model series.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.