Kandinsky 6.0: generación de vídeo y audio en ComfyUI
Pesos abiertos de Kandinsky 6.0 para ComfyUI: Pro (29B) y Lite (3B) generan vídeo de 5 segundos con audio sincronizado a 44 kHz, además de superresolución hasta Full HD.
El póster promocional oficial de Kandinsky 6.0.
Qué hay de nuevo en Kandinsky 6.0
Kandinsky 6.0 Video es una familia de modelos de difusión fundacionales que generan vídeo y audio a la vez, en lugar de doblar una banda sonora después. La línea se divide en dos tamaños:
- Kandinsky 6.0 Video Pro: 29B parámetros, la línea insignia.
- Kandinsky 6.0 Video Lite: 3B parámetros, la línea compacta.
Cada uno se distribuye en tres formas: un checkpoint base, un checkpoint destilado de 10 pasos para iteraciones rápidas y un checkpoint preentrenado. Todos generan clips de 5 segundos a 24 fps con audio sincronizado a 44 kHz, que cubre diálogo, ambiente y música, en dos modos:
- Texto a audio-vídeo (T2AV): un único prompt de texto produce el clip y su banda sonora.
- Imagen a audio-vídeo (TI2AV): una imagen de referencia condiciona el primer fotograma, y el prompt describe lo que ocurre a continuación.
La arquitectura es un transformer de difusión multimodal de vídeo y audio (Kandinsky6Transformer3DModel) con un codificador de texto Qwen2.5-VL para embeddings de texto a nivel de token y un embedding agrupado de CLIP, junto con un VAE de Hunyuan Video para la parte visual y un VAE de MMAudio más un vocoder estilo BigVGAN para el audio. La programación es flow matching con shift = 5.0.
Hay dos interruptores de inferencia que conviene conocer. sample_audio=False genera solo vídeo, y expand_prompts=True permite que el codificador de texto Qwen2.5-VL reescriba una petición corta en una detallada antes de codificarla, lo que añade latencia pero no pesos adicionales.
Demostración oficial de Kandinsky 6.0.
Superresolución hasta Full HD
La generación trabaja a 480x864 en los ejemplos anteriores. Una segunda pipeline, Kandinsky6SRPipeline, toma esos fotogramas y los amplía x2, x2.25 o x4 con difusión por mosaico en el espacio latente de K-VAE, fusionando de nuevo los mosaicos superpuestos con ventanas Hann. El checkpoint de flow matching se ejecuta en 4 pasos por mosaico, y el checkpoint VSR destilado lo reduce a 2.
Uno de los clips de muestra oficiales.
Kandinsky 6.0 en ComfyUI
Kandinsky Lab publica una extensión de ComfyUI de primera parte junto con los pesos. Se instala desde el Registro de ComfyUI como dos paquetes, kandinsky6 y kandinsky6-sr, y requiere ComfyUI 0.38.0 o superior con Python 3.10+. La carga y la descarga de memoria de los modelos las gestiona el propio ComfyUI, por lo que no se necesitan parches del núcleo.
La extensión incluye dos plantillas listas para usar que de forma predeterminada utilizan Pro distilled PiFlow (10 pasos, CFG=1) con un retrato de referencia I2VA:
Las dos plantillas incluidas: texto a vídeo+audio e imagen a vídeo+audio.
El Pro no destilado y MagCache siguen siendo compatibles, y MagCache se omite automáticamente en los modelos destilados. Las líneas habladas se escriben directamente en el caption del vídeo entre los marcadores <S> y <E>, mientras que la voz y otros sonidos se describen en un caption de audio aparte. Ambas plantillas incluyen el embellecimiento de prompt nativo con Qwen3.5-9B, que se puede desactivar en el nodo, y la extensión SR es opcional pero necesaria para los flujos de trabajo incluidos.
Archivos de modelo
Los flujos de trabajo oficiales de ComfyUI toman la mayoría de sus archivos de los repositorios de Kandinsky Lab, reutilizando los codificadores de texto y el VAE de vídeo compartidos de los paquetes existentes de Comfy-Org:
📂 ComfyUI/
└── 📂 models/
├── 📂 diffusion_models/
│ ├── Kandinsky-6.0-Pro-distill-5s-Diffusers/transformer/diffusion_pytorch_model.safetensors
│ └── Kandinsky-6.0-VSR-distilled2steps-5s-Diffusers/
├── 📂 text_encoders/
│ ├── qwen3.5_9b_bf16.safetensors
│ └── qwen_2.5_vl_7b.safetensors
└── 📂 audio_vae/
├── v1-44.pth
└── bigvgan_vocoder/bigvgan_generator.ptEl botón Download models de la extensión coloca automáticamente todos estos archivos, además de las configuraciones JSON complementarias que necesita cada carpeta de Diffusers, en los directorios correctos de ComfyUI.
Disponibilidad
Los pesos están en Hugging Face bajo kandinskylab, con el código, la extensión de ComfyUI y el informe técnico en kandinskylab/kandinsky-6. Kandinsky 6.0 también está disponible a través de Diffusers (Kandinsky6TI2VAPipeline y Kandinsky6SRPipeline), vLLM-Omni y un Space de demostración en Hugging Face que ejecuta el checkpoint destilado Pro.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.