Kandinsky 6.0: ComfyUIで動画と音声を生成

ComfyUI Wikinews

ComfyUI向けKandinsky 6.0のオープンウェイト: 29B Proと3B Liteが44 kHzの同期音声付き5秒動画を生成し、フルHDまでの超解像にも対応。

Kandinsky Labは10月6日、Kandinsky 6.0 Videoをオープンソース化しました。同期したテキストから音声・動画を生成する拡散モデルファミリーです。Kandinsky 6.0 Video Pro (29B)とKandinsky 6.0 Video Lite (3B)はいずれも44 kHzの同期音声付き5秒クリップを生成し、リップシンクにも対応しています。モードはテキストから音声・動画生成 (T2AV) と画像から音声・動画生成 (TI2AV) の2種類で、別途用意された超解像モデルを使うと出力をフルHDまで引き上げられます。ComfyUIのサポートは同日、2つのすぐに実行できるワークフローテンプレートを備えたファーストパーティ拡張として提供されます。
Kandinsky 6.0 official promo

Kandinsky 6.0の公式プロモ。

Kandinsky 6.0の新機能

Kandinsky 6.0 Videoは、後から音声を吹き替えるのではなく、動画と音声を同時に生成する基盤拡散モデルのファミリーです。ラインナップは2つのサイズに分かれます。

  • Kandinsky 6.0 Video Pro: 29Bパラメータのフラッグシップライン。
  • Kandinsky 6.0 Video Lite: 3Bパラメータのコンパクトライン。

それぞれが3つの形式で提供されます。ベースcheckpoint、高速な反復生成のための蒸留10ステップcheckpoint、そして事前学習済みcheckpointです。いずれも24 fpsで44 kHzの同期音声付き5秒クリップを生成し、会話、環境音、音楽をカバーします。モードは次の2つです。

  • テキストから音声・動画生成 (T2AV): 1つのテキストプロンプトからクリップとそのサウンドトラックを生成します。
  • 画像から音声・動画生成 (TI2AV): 参照画像が最初のフレームを条件付けし、プロンプトがその後に起きる内容を記述します。

アーキテクチャはマルチモーダルな動画・音声拡散transformer (Kandinsky6Transformer3DModel) で、トークンレベルのテキストembedding用にQwen2.5-VLテキストエンコーダーとCLIP pooled embeddingを備え、映像側にはHunyuan Video VAE、音声側にはMMAudio VAEとBigVGAN系のvocoderを組み合わせています。スケジューリングはflow matchingで shift = 5.0 です。

知っておきたい推論スイッチが2つあります。sample_audio=False は動画のみを生成し、expand_prompts=True はQwen2.5-VLテキストエンコーダーが短いリクエストをエンコード前に詳細なものへ書き換えられるようにします。レイテンシは増えますが、追加のウェイトは不要です。

Kandinsky 6.0の公式ショーケース。

フルHDへの超解像

上記の例では480x864で生成しています。2つ目のpipelineである Kandinsky6SRPipeline は、これらのフレームを受け取り、K-VAE潜在空間でのタイル拡散によってx2、x2.25、x4にアップスケールし、重なり合うタイルをHann窓で再びブレンドします。flow matchingのcheckpointはタイルあたり4ステップで実行され、蒸留VSR checkpointを使うと2ステップに短縮されます。

公式サンプルクリップの1つ。

ComfyUIでのKandinsky 6.0

Kandinsky Labはウェイトと同時にファーストパーティのComfyUI拡張を公開しています。ComfyUI Registryから kandinsky6 と kandinsky6-sr の2つのパッケージとしてインストールでき、ComfyUI 0.38.0 以降とPython 3.10+が必要です。モデルの読み込みとオフロードはComfyUI自身が処理するため、コアへのパッチは不要です。

この拡張には、I2VAの参照ポートレートを使う**Pro distilled PiFlow (10 steps, CFG=1)**をデフォルトとする、すぐに実行できる2つのテンプレートが含まれています。

Kandinsky 6.0 text to video and audio template Kandinsky 6.0 image to video and audio template

同梱の2つのテンプレート: テキストから動画+音声、画像から動画+音声。

蒸留されていないProとMagCacheも引き続きサポートされ、蒸留モデルではMagCacheは自動的にバイパスされます。話されるセリフは <S> と <E> のマーカーで囲んで動画キャプションに直接書き込み、音声やその他の音は別の音声キャプションに記述します。どちらのテンプレートにもネイティブのQwen3.5-9Bによるプロンプト整形が含まれており、ノード内でオフにできます。SR拡張は任意ですが、同梱のワークフローでは必要です。

ComfyUIにはネイティブ統合もレビュー中です: Comfy-Org/ComfyUI #16825 はKandinsky 6.0の音声・動画ノードをコアに追加します。マージされるまでは、上記のRegistry拡張が公式の方法です。

モデルファイル

公式のComfyUIワークフローは、ほとんどのファイルをKandinsky Labのリポジトリから取得し、共有のテキストエンコーダーと動画VAEは既存のComfy-Orgパッケージから再利用します。

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   ├── Kandinsky-6.0-Pro-distill-5s-Diffusers/transformer/diffusion_pytorch_model.safetensors
    │   └── Kandinsky-6.0-VSR-distilled2steps-5s-Diffusers/
    ├── 📂 text_encoders/
    │   ├── qwen3.5_9b_bf16.safetensors
    │   └── qwen_2.5_vl_7b.safetensors
    └── 📂 audio_vae/
        ├── v1-44.pth
        └── bigvgan_vocoder/bigvgan_generator.pt

拡張のDownload modelsボタンは、これらすべてと、各Diffusersフォルダーが必要とする付属のJSON設定を、適切なComfyUIディレクトリに自動で配置します。

入手方法

ウェイトはHugging Faceの kandinskylab で公開されており、コード、ComfyUI拡張、技術報告は kandinskylab/kandinsky-6 にあります。Kandinsky 6.0はDiffusers (Kandinsky6TI2VAPipeline と Kandinsky6SRPipeline)、vLLM-Omni、そしてPro蒸留checkpointを実行するHugging FaceデモSpaceからも利用できます。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Kandinsky 6.0: ComfyUIで動画と音声を生成 | ComfyUI Wiki