Kandinsky 6.0: установка в ComfyUI и руководство по моделям
Запуск Kandinsky 6.0 в ComfyUI: Pro на 29B и Lite на 3B генерируют 5-секундное видео с синхронизированным аудио 44 кГц, плюс модель суперразрешения до Full HD.
Kandinsky 6.0
Video GenerationAudio-VideoText-to-VideoImage-to-VideoComfyUIKandinsky 6.0 Video: семейство фундаментальных диффузионных моделей для синхронизированной генерации текста, аудио и видео. Pro (29B) и Lite (3B) создают 5-секундные клипы с синхронизированным аудио 44 кГц, включая lip-sync, в режимах text-to-audio-video и image-to-audio-video, а отдельная модель суперразрешения поднимает выход до Full HD.
| Разработчик | Kandinsky Lab |
| Дата выпуска | 2026-10-06 (открытые веса) |
| Архитектура | Мультимодальный видео- и аудио-диффузионный трансформер с flow matching (29B Pro, 3B Lite) |
| Текстовый энкодер | Qwen2.5-VL с объединённым эмбеддингом CLIP |
| Аудио | MMAudio VAE и вокодер в стиле BigVGAN, синхронизированный выход 44 кГц |
| Выход | 5-секундные клипы при 24 fps, до Full HD после суперразрешения |
| Режимы генерации | Text-to-audio-video, image-to-audio-video |
| Лицензия | MIT |
Kandinsky 6.0 Video генерирует изображение и звуковую дорожку вместе за один проход, а не озвучивает видео постфактум. Мультимодальный видео- и аудио-диффузионный трансформер моделирует оба потока: текстовый энкодер Qwen2.5-VL предоставляет текстовые эмбеддинги на уровне токенов, а модель CLIP — объединённый эмбеддинг. Визуальная часть декодируется через Hunyuan Video VAE, а аудио-часть использует MMAudio VAE и вокодер в стиле BigVGAN для вывода波形 44 кГц. Выборка выполняется методом flow matching с shift = 5.0.
Модели
Семейство выпускается в двух размерах, каждый с базовым, дистиллированным 10-шаговым и предобученным чекпойнтом, плюс отдельная пара для суперразрешения:
| Чекпойнт | Размер | Примечания |
|---|---|---|
| Kandinsky 6.0 Pro | 29B | Флагманский чекпойнт генерации |
| Kandinsky 6.0 Pro distill | 29B | Дистиллирован до 10 шагов с PiFlow, используется по умолчанию в шаблонах ComfyUI |
| Kandinsky 6.0 Pro pretrain | 29B | Предобученная база для дообучения |
| Kandinsky 6.0 Lite | 3B | Компактный чекпойнт генерации |
| Kandinsky 6.0 Lite distill | 3B | Дистиллированный 10-шаговый вариант |
| Kandinsky 6.0 Lite pretrain | 3B | Предобученная база для дообучения |
| Kandinsky 6.0 VSR | - | Пайплайн суперразрешения, x2, x2.25 и x4, 4 шага на плитку |
| Kandinsky 6.0 VSR distill | - | Дистиллированное суперразрешение, 2 шага на плитку |
Суперразрешение
Kandinsky6SRPipeline увеличивает сгенерированные кадры с помощью плиточной диффузии в латентном пространстве K-VAE и смешивает перекрывающиеся плитки с помощью окон Ханна. resolution_scale принимает значения 2, 2.25 (маршрут по умолчанию после генерации) или 4, а min_overlap и tiles_batch_size обменивают смешивание плиток и VRAM на скорость.
ComfyUI
Официальное расширение для ComfyUI публикуется kandinskylab в ComfyUI Registry как kandinsky6 и kandinsky6-sr. Установите оба через ComfyUI Manager, перезапустите и откройте Workflow → Browse Templates → kandinsky6 для встроенных шаблонов Text to Video+Audio и Image to Video+Audio. Файлы моделей, включая сопутствующие JSON-конфиги Diffusers, загружаются кнопкой Download models расширения в правильные папки ComfyUI.
Ресурсы
Guides and workflows related to this model series.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.