Kandinsky 6.0: configuración en ComfyUI y guía de modelos

ComfyUI Wiki

Ejecuta Kandinsky 6.0 en ComfyUI: Pro de 29B y Lite de 3B generan vídeo de 5 segundos con audio sincronizado a 44 kHz, además de un modelo de superresolución para Full HD.

K

Kandinsky 6.0

Video GenerationAudio-VideoText-to-VideoImage-to-VideoComfyUI

Kandinsky 6.0 Video es una familia de modelos de difusión fundacionales para la generación sincronizada de texto a audio y vídeo. Pro (29B) y Lite (3B) producen clips de 5 segundos con audio sincronizado a 44 kHz, incluido el lip-sync, en modos de texto a audio-vídeo e imagen a audio-vídeo, y un modelo de superresolución independiente eleva la salida a Full HD.

DesarrolladorKandinsky Lab
Fecha de lanzamiento2026-10-06 (pesos abiertos)
ArquitecturaTransformer de difusión multimodal de vídeo y audio con flow matching (Pro de 29B, Lite de 3B)
Codificador de textoQwen2.5-VL con un embedding agrupado de CLIP
AudioVAE de MMAudio y vocoder estilo BigVGAN, salida sincronizada a 44 kHz
SalidaClips de 5 segundos a 24 fps, hasta Full HD después de la superresolución
Modos de generaciónTexto a audio-vídeo, imagen a audio-vídeo
LicenciaMIT

Kandinsky 6.0 Video genera la imagen y la banda sonora juntas en una sola pasada, en lugar de doblar el audio a posteriori. Un transformer de difusión multimodal de vídeo y audio modela ambas señales, con un codificador de texto Qwen2.5-VL que aporta embeddings de texto a nivel de token y un modelo CLIP que aporta un embedding agrupado. El lado visual decodifica mediante un VAE de Hunyuan Video, y el lado de audio ejecuta un VAE de MMAudio más un vocoder estilo BigVGAN para obtener una onda de salida a 44 kHz. El muestreo utiliza flow matching con shift = 5.0.

Modelos

La familia se distribuye en dos tamaños, cada uno con un checkpoint base, uno destilado de 10 pasos y uno preentrenado, además de un par dedicado de superresolución:

CheckpointTamañoNotas
Kandinsky 6.0 Pro29BCheckpoint de generación insignia
Kandinsky 6.0 Pro distill29BDestilado a 10 pasos con PiFlow, usado por defecto en las plantillas de ComfyUI
Kandinsky 6.0 Pro pretrain29BBase preentrenada para fine-tuning
Kandinsky 6.0 Lite3BCheckpoint de generación compacto
Kandinsky 6.0 Lite distill3BVariante destilada de 10 pasos
Kandinsky 6.0 Lite pretrain3BBase preentrenada para fine-tuning
Kandinsky 6.0 VSR-Pipeline de superresolución, x2, x2.25 y x4, 4 pasos por mosaico
Kandinsky 6.0 VSR distill-Superresolución destilada, 2 pasos por mosaico

Superresolución

Kandinsky6SRPipeline aumenta la resolución de los fotogramas generados con difusión por mosaicos en el espacio latente de K-VAE y combina los mosaicos superpuestos con ventanas de Hann. resolution_scale acepta 2, 2.25 (la ruta predeterminada después de la generación) o 4, y min_overlap y tiles_batch_size intercambian la combinación de mosaicos y la VRAM por velocidad.

ComfyUI

La extensión oficial de ComfyUI la publica kandinskylab en el ComfyUI Registry como kandinsky6 y kandinsky6-sr. Instala ambas a través del Administrador de ComfyUI, reinicia y abre Workflow → Explorar plantillas → kandinsky6 para acceder a las plantillas incluidas Text to Video+Audio e Image to Video+Audio. Los archivos de modelo, incluidos los JSON de configuración de Diffusers que los acompañan, se descargan con el botón Download models de la extensión en las carpetas correctas de ComfyUI.

Recursos

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…