Kandinsky 6.0 : installation ComfyUI et guide du modèle
Kandinsky 6.0 dans ComfyUI : Pro 29B et Lite 3B génèrent une vidéo de 5 s avec audio synchronisé 44 kHz, plus une super-résolution Full HD.
Kandinsky 6.0
Video GenerationAudio-VideoText-to-VideoImage-to-VideoComfyUIKandinsky 6.0 Video est une famille de modèles de diffusion fondamentaux pour la génération synchronisée texte-audio-vidéo. Pro (29B) et Lite (3B) produisent tous deux des clips de 5 secondes avec audio synchronisé en 44 kHz, y compris le lip-sync, en modes texte-audio-vidéo et image-audio-vidéo, et un modèle de super-résolution distinct porte la sortie en Full HD.
Kandinsky 6.0 Video génère l'image et la bande sonore ensemble en une seule passe plutôt que d'ajouter l'audio après coup. Un transformer de diffusion multimodal vidéo et audio modélise les deux flux, avec un encodeur de texte Qwen2.5-VL qui fournit des embeddings de texte au niveau des tokens et un modèle CLIP qui fournit un embedding pooled. Le versant visuel se décode via un VAE Hunyuan Video, et le versant audio utilise un VAE MMAudio ainsi qu'un vocoder de type BigVGAN pour produire une forme d'onde en 44 kHz. L'échantillonnage utilise le flow matching avec shift = 5.0.
Modèles
La famille est proposée en deux tailles, chacune avec un checkpoint de base, un checkpoint distillé en 10 étapes et un checkpoint pré-entraîné, plus une paire dédiée à la super-résolution :
| Checkpoint | Taille | Remarques |
|---|---|---|
| Kandinsky 6.0 Pro | 29B | Checkpoint de génération phare |
| Kandinsky 6.0 Pro distill | 29B | Distillé en 10 étapes avec PiFlow, utilisé par défaut dans les modèles ComfyUI |
| Kandinsky 6.0 Pro pretrain | 29B | Base pré-entraînée pour le fine-tuning |
| Kandinsky 6.0 Lite | 3B | Checkpoint de génération compact |
| Kandinsky 6.0 Lite distill | 3B | Variante distillé en 10 étapes |
| Kandinsky 6.0 Lite pretrain | 3B | Base pré-entraînée pour le fine-tuning |
| Kandinsky 6.0 VSR | - | Pipeline de super-résolution, x2, x2.25 et x4, 4 étapes par tuile |
| Kandinsky 6.0 VSR distill | - | Super-résolution distillé, 2 étapes par tuile |
Super-résolution
Kandinsky6SRPipeline met à l'échelle les images générées avec une diffusion en mosaïque dans l'espace latent K-VAE et fusionne les tuiles qui se chevauchent avec des fenêtres de Hann. resolution_scale accepte 2, 2.25 (la route par défaut après la génération) ou 4, et min_overlap et tiles_batch_size arbitrent entre la fusion des tuiles et la VRAM, au détriment de la vitesse.
ComfyUI
L'extension officielle ComfyUI est publiée par kandinskylab sur le ComfyUI Registry sous les noms kandinsky6 et kandinsky6-sr. Installez les deux via ComfyUI Manager, redémarrez, puis ouvrez Flux de travail → Parcourir les modèles → kandinsky6 pour les modèles Text to Video+Audio et Image to Video+Audio fournis. Les fichiers de modèle, y compris les configurations JSON Diffusers associées, sont récupérés par le bouton Télécharger les modèles de l'extension dans les dossiers ComfyUI appropriés.
Ressources
Guides and workflows related to this model series.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.