Kandinsky 6.0: установка в ComfyUI и руководство по моделям

ComfyUI Wiki

Запуск Kandinsky 6.0 в ComfyUI: Pro на 29B и Lite на 3B генерируют 5-секундное видео с синхронизированным аудио 44 кГц, плюс модель суперразрешения до Full HD.

K

Kandinsky 6.0

Video GenerationAudio-VideoText-to-VideoImage-to-VideoComfyUI

Kandinsky 6.0 Video: семейство фундаментальных диффузионных моделей для синхронизированной генерации текста, аудио и видео. Pro (29B) и Lite (3B) создают 5-секундные клипы с синхронизированным аудио 44 кГц, включая lip-sync, в режимах text-to-audio-video и image-to-audio-video, а отдельная модель суперразрешения поднимает выход до Full HD.

РазработчикKandinsky Lab
Дата выпуска2026-10-06 (открытые веса)
АрхитектураМультимодальный видео- и аудио-диффузионный трансформер с flow matching (29B Pro, 3B Lite)
Текстовый энкодерQwen2.5-VL с объединённым эмбеддингом CLIP
АудиоMMAudio VAE и вокодер в стиле BigVGAN, синхронизированный выход 44 кГц
Выход5-секундные клипы при 24 fps, до Full HD после суперразрешения
Режимы генерацииText-to-audio-video, image-to-audio-video
ЛицензияMIT

Kandinsky 6.0 Video генерирует изображение и звуковую дорожку вместе за один проход, а не озвучивает видео постфактум. Мультимодальный видео- и аудио-диффузионный трансформер моделирует оба потока: текстовый энкодер Qwen2.5-VL предоставляет текстовые эмбеддинги на уровне токенов, а модель CLIP — объединённый эмбеддинг. Визуальная часть декодируется через Hunyuan Video VAE, а аудио-часть использует MMAudio VAE и вокодер в стиле BigVGAN для вывода波形 44 кГц. Выборка выполняется методом flow matching с shift = 5.0.

Модели

Семейство выпускается в двух размерах, каждый с базовым, дистиллированным 10-шаговым и предобученным чекпойнтом, плюс отдельная пара для суперразрешения:

ЧекпойнтРазмерПримечания
Kandinsky 6.0 Pro29BФлагманский чекпойнт генерации
Kandinsky 6.0 Pro distill29BДистиллирован до 10 шагов с PiFlow, используется по умолчанию в шаблонах ComfyUI
Kandinsky 6.0 Pro pretrain29BПредобученная база для дообучения
Kandinsky 6.0 Lite3BКомпактный чекпойнт генерации
Kandinsky 6.0 Lite distill3BДистиллированный 10-шаговый вариант
Kandinsky 6.0 Lite pretrain3BПредобученная база для дообучения
Kandinsky 6.0 VSR-Пайплайн суперразрешения, x2, x2.25 и x4, 4 шага на плитку
Kandinsky 6.0 VSR distill-Дистиллированное суперразрешение, 2 шага на плитку

Суперразрешение

Kandinsky6SRPipeline увеличивает сгенерированные кадры с помощью плиточной диффузии в латентном пространстве K-VAE и смешивает перекрывающиеся плитки с помощью окон Ханна. resolution_scale принимает значения 2, 2.25 (маршрут по умолчанию после генерации) или 4, а min_overlap и tiles_batch_size обменивают смешивание плиток и VRAM на скорость.

ComfyUI

Официальное расширение для ComfyUI публикуется kandinskylab в ComfyUI Registry как kandinsky6 и kandinsky6-sr. Установите оба через ComfyUI Manager, перезапустите и откройте Workflow → Browse Templates → kandinsky6 для встроенных шаблонов Text to Video+Audio и Image to Video+Audio. Файлы моделей, включая сопутствующие JSON-конфиги Diffusers, загружаются кнопкой Download models расширения в правильные папки ComfyUI.

Ресурсы

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…