Kandinsky 6.0 : génération de vidéo et d'audio dans ComfyUI
Kandinsky 6.0 en poids ouverts pour ComfyUI : Pro 29B et Lite 3B génèrent des vidéos de 5 secondes avec audio synchronisé à 44 kHz, plus une super-résolution jusqu'à la Full HD.
Le visuel promotionnel officiel de Kandinsky 6.0.
Quoi de neuf dans Kandinsky 6.0
Kandinsky 6.0 Video est une famille de modèles de diffusion de base qui génèrent vidéo et audio ensemble, au lieu de doubler une bande-son après coup. La gamme se décline en deux tailles :
- Kandinsky 6.0 Video Pro : 29B paramètres, la ligne phare.
- Kandinsky 6.0 Video Lite : 3B paramètres, la ligne compacte.
Chacun est proposé en trois versions : un checkpoint de base, un checkpoint distillé en 10 étapes pour des itérations rapides, et un checkpoint pré-entraîné. Tous génèrent des clips de 5 secondes à 24 fps avec un audio synchronisé à 44 kHz, couvrant dialogues, ambiance et musique, selon deux modes :
- Texte-vers-audio-vidéo (T2AV) : un simple prompt texte produit le clip et sa bande-son.
- Image-vers-audio-vidéo (TI2AV) : une image de référence conditionne la première frame, et le prompt décrit ce qui se passe ensuite.
L'architecture est un transformer de diffusion vidéo et audio multimodal (Kandinsky6Transformer3DModel) avec un encodeur de texte Qwen2.5-VL pour les embeddings de texte au niveau des tokens et un embedding poolé CLIP, associé à un VAE Hunyuan Video pour la partie visuelle et à un VAE MMAudio plus un vocoder de type BigVGAN pour l'audio. La planification repose sur le flow matching avec shift = 5.0.
Deux options d'inférence méritent d'être connues. sample_audio=False génère uniquement de la vidéo, et expand_prompts=True permet à l'encodeur de texte Qwen2.5-VL de réécrire une requête courte en une requête détaillée avant l'encodage, ce qui ajoute de la latence mais aucun poids supplémentaire.
Démonstration officielle de Kandinsky 6.0.
Super-résolution jusqu'à la Full HD
La génération fonctionne en 480x864 dans les exemples ci-dessus. Un second pipeline, Kandinsky6SRPipeline, prend ces frames et les agrandit par x2, x2,25 ou x4 avec une diffusion en mosaïque dans l'espace latent K-VAE, en fusionnant les tuiles qui se chevauchent grâce à des fenêtres de Hann. Le checkpoint flow-matching tourne en 4 étapes par tuile, et le checkpoint VSR distillé réduit cela à 2.
L'un des clips d'exemple officiels.
Kandinsky 6.0 dans ComfyUI
Kandinsky Lab publie une extension ComfyUI officielle en parallèle des poids. Elle s'installe depuis le ComfyUI Registry sous la forme de deux paquets, kandinsky6 et kandinsky6-sr, et nécessite ComfyUI 0.38.0 ou plus récent avec Python 3.10+. Le chargement et le déchargement des modèles sont gérés par ComfyUI lui-même, aucun correctif du cœur n'est donc nécessaire.
L'extension fournit deux modèles prêts à l'emploi qui utilisent par défaut Pro distilled PiFlow (10 étapes, CFG=1) avec un portrait de référence I2VA :
Les deux modèles fournis : texte vers vidéo+audio, et image vers vidéo+audio.
Le Pro non distillé et MagCache restent pris en charge, et MagCache est contourné automatiquement pour les modèles distillés. Les répliques parlées sont écrites directement dans la légende vidéo entre les marqueurs <S> et <E>, tandis que la voix et les autres sons sont décrits dans une légende audio séparée. Les deux modèles incluent l'embellissement de prompt natif Qwen3.5-9B, désactivable dans le nœud, et l'extension SR est facultative mais requise par les flux de travail fournis.
Fichiers de modèle
Les flux de travail ComfyUI officiels récupèrent la majorité de leurs fichiers depuis les dépôts Kandinsky Lab, les encodeurs de texte partagés et le VAE vidéo étant réutilisés depuis les paquets Comfy-Org existants :
📂 ComfyUI/
└── 📂 models/
├── 📂 diffusion_models/
│ ├── Kandinsky-6.0-Pro-distill-5s-Diffusers/transformer/diffusion_pytorch_model.safetensors
│ └── Kandinsky-6.0-VSR-distilled2steps-5s-Diffusers/
├── 📂 text_encoders/
│ ├── qwen3.5_9b_bf16.safetensors
│ └── qwen_2.5_vl_7b.safetensors
└── 📂 audio_vae/
├── v1-44.pth
└── bigvgan_vocoder/bigvgan_generator.ptLe bouton Download models de l'extension place automatiquement tout cela, ainsi que les fichiers de configuration JSON d'accompagnement dont chaque dossier Diffusers a besoin, dans les bons répertoires ComfyUI.
Disponibilité
Les poids sont sur Hugging Face sous kandinskylab, avec le code, l'extension ComfyUI et le rapport technique dans kandinskylab/kandinsky-6. Kandinsky 6.0 est également disponible via Diffusers (Kandinsky6TI2VAPipeline et Kandinsky6SRPipeline), vLLM-Omni, et un Space de démonstration Hugging Face exécutant le checkpoint Pro distillé.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.