Kandinsky 6.0: генерация видео и аудио в ComfyUI

ComfyUI Wikinews

Открытые веса Kandinsky 6.0 для ComfyUI: 29B Pro и 3B Lite генерируют 5-секундное видео с синхронизированным аудио 44 кГц, а также суперразрешение вплоть до Full HD.

Kandinsky Lab открыла исходный код Kandinsky 6.0 Video 6 октября: это семейство диффузионных моделей для синхронизированной генерации видео и аудио по тексту. Kandinsky 6.0 Video Pro (29B) и Kandinsky 6.0 Video Lite (3B) обе создают 5-секундные клипы с синхронизированным аудио 44 кГц, включая lip-sync, в режимах text-to-audio-video (T2AV) и image-to-audio-video (TI2AV), а отдельная модель суперразрешения поднимает результат до Full HD. Поддержка в ComfyUI выходит в тот же день в виде расширения от разработчика с двумя готовыми шаблонами рабочих процессов.
Официальный промо-материал Kandinsky 6.0

Официальный промо Kandinsky 6.0.

Что нового в Kandinsky 6.0

Kandinsky 6.0 Video: семейство базовых диффузионных моделей, которые генерируют видео и аудио вместе, а не озвучивают дорожку постфактум. Линейка делится на два размера:

  • Kandinsky 6.0 Video Pro: 29B параметров, флагманская линейка.
  • Kandinsky 6.0 Video Lite: 3B параметров, компактная линейка.

Каждая поставляется в трёх вариантах: базовый checkpoint, дистиллированный 10-шаговый checkpoint для быстрых итераций и предобученный checkpoint. Все они генерируют 5-секундные клипы с частотой 24 fps и синхронизированным аудио 44 кГц, охватывающим диалоги, фоновые шумы и музыку, в двух режимах:

  • Text-to-audio-video (T2AV): один текстовый промпт создаёт клип и его звуковую дорожку.
  • Image-to-audio-video (TI2AV): референсное изображение задаёт первый кадр, а промпт описывает, что происходит дальше.

Архитектура представляет собой мультимодальный диффузионный трансформер для видео и аудио (Kandinsky6Transformer3DModel) с текстовым энкодером Qwen2.5-VL для текстовых эмбеддингов на уровне токенов и pooled-эмбеддингом CLIP, в паре с Hunyuan Video VAE для визуальной части и MMAudio VAE плюс вокодером в стиле BigVGAN для аудио. Планирование выполняется методом flow matching с shift = 5.0.

Стоит знать о двух переключателях вывода. sample_audio=False генерирует только видео, а expand_prompts=True позволяет текстовому энкодеру Qwen2.5-VL переписать короткий запрос в подробный перед кодированием, что добавляет задержку, но не требует дополнительных весов.

Официальная демонстрация Kandinsky 6.0.

Суперразрешение до Full HD

В примерах выше генерация идёт в разрешении 480x864. Второй пайплайн, Kandinsky6SRPipeline, берёт эти кадры и увеличивает их в x2, x2.25 или x4 с помощью плиточной диффузии в латентном пространстве K-VAE, вновь склеивая перекрывающиеся плитки с помощью окон Ханна. Checkpoint на flow matching выполняет 4 шага на плитку, а дистиллированный VSR checkpoint сокращает это до 2.

Один из официальных примеров клипов.

Kandinsky 6.0 в ComfyUI

Kandinsky Lab публикует официальное расширение ComfyUI вместе с весами. Оно устанавливается из ComfyUI Registry как два пакета, kandinsky6 и kandinsky6-sr, и требует ComfyUI 0.38.0 или новее с Python 3.10+. Загрузка и выгрузка моделей выполняются самим ComfyUI, поэтому патчи ядра не нужны.

Расширение включает два готовых к запуску шаблона, которые по умолчанию используют Pro distilled PiFlow (10 шагов, CFG=1) с референсным портретом для I2VA:

Шаблон Kandinsky 6.0 текст в видео и аудио Шаблон Kandinsky 6.0 изображение в видео и аудио

Два встроенных шаблона: текст в видео+аудио и изображение в видео+аудио.

Недистиллированный Pro и MagCache остаются поддерживаемыми, при этом MagCache автоматически обходится для дистиллированных моделей. Произносимые реплики записываются прямо в подпись видео между маркерами <S> и <E>, а голос и другие звуки описываются в отдельной аудиоподписи. Оба шаблона включают нативное улучшение промптов с помощью Qwen3.5-9B, которое можно отключить в ноде, а расширение SR необязательно, но необходимо для встроенных рабочих процессов.

В ComfyUI также находится на рассмотрении нативная интеграция: Comfy-Org/ComfyUI #16825 добавляет ноды аудио-видео Kandinsky 6.0 в ядро. Пока она не объединена, официальным путём остаётся расширение из реестра, указанное выше.

Файлы моделей

Официальные рабочие процессы ComfyUI берут большинство файлов из репозиториев Kandinsky Lab, а общие текстовые энкодеры и видео VAE переиспользуются из существующих пакетов Comfy-Org:

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   ├── Kandinsky-6.0-Pro-distill-5s-Diffusers/transformer/diffusion_pytorch_model.safetensors
    │   └── Kandinsky-6.0-VSR-distilled2steps-5s-Diffusers/
    ├── 📂 text_encoders/
    │   ├── qwen3.5_9b_bf16.safetensors
    │   └── qwen_2.5_vl_7b.safetensors
    └── 📂 audio_vae/
        ├── v1-44.pth
        └── bigvgan_vocoder/bigvgan_generator.pt

Кнопка Download models в расширении автоматически размещает всё это, а также сопутствующие JSON-конфиги, необходимые каждой папке Diffusers, в нужных каталогах ComfyUI.

Доступность

Веса опубликованы на Hugging Face в организации kandinskylab, а код, расширение ComfyUI и технический отчёт находятся в репозитории kandinskylab/kandinsky-6. Kandinsky 6.0 также доступен через Diffusers (Kandinsky6TI2VAPipeline и Kandinsky6SRPipeline), vLLM-Omni и демо-пространство Hugging Face, работающее на дистиллированном checkpoint Pro.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
Kandinsky 6.0: генерация видео и аудио в ComfyUI | ComfyUI Wiki