Qwen-Video-Edit: 指示ベースの動画編集、ComfyUI ノード対応
Qwen-Video-Edit は Qwen-Image-Edit の DiT を再利用して Wan 2.1 の動画潜在表現をテキスト指示で直接編集するモデル。公式 ComfyUI カスタムノードと 360P/480P/720P チェックポイントを提供する。
Qwen-Video-Edit は、Qwen-Image-Edit の DiT を再利用して Wan 2.1 の動画 VAE 潜在表現を直接編集する指示ベースの動画編集モデルで、動画事前学習済み Transformer を必要としません。最初のリリースは 8 月 14 日(コード、論文、360P チェックポイント)。8 月 20 日には公式 ComfyUI 対応と 480P・720P チェックポイントが追加されました。
この研究は Yunpeng Bai(テキサス大学オースティン校)、Yossi Gandelsman、Michaël Gharbi(Adobe)、Qixing Huang(テキサス大学オースティン校)によるもので、論文と、前後比較デモが豊富なプロジェクトページが公開されています。
異なる指示でチャンク単位に編集した長尺動画のデモ:左がソース、右が編集結果。
仕組み
Qwen-Video-Edit は動画拡散 Transformer を適合させる代わりに、画像編集モデルに動画の潜在表現を直接扱わせます。
- ウォームスタート投影 — 2 つの小さな学習可能な投影が Wan 2.1 の 16 チャンネル動画潜在表現を DiT のトークン空間に橋渡し。DiT 自身の入出力層から初期化されるため、静止画の埋め込みは Qwen 画像と同一になります
- グリッド位置エンコーディング — 潜在フレームを仮想的な大きな画像のタイルとして配置し、画像モデルの事前分布に合わせます
- プロンプト + フレームグリッドプレビュー — Qwen2.5-VL ブランチがソースフレームのプレビューと一緒に指示をエンコードします
凍結された Wan 2.1 VAE がエンコードとデコードを担い、任意の Wan 2.2 ノイズ除去強化ステージ(Ditto 由来)が編集後の潜在表現を仕上げます。
「動画をパステルカラーの童話絵本イラストに変換して」— プロジェクトページのギャラリーより編集結果。
ComfyUI ノード
このリポジトリは ComfyUI カスタムノードパックを兼ねており、QwenVideoEdit カテゴリに 3 つのノードを提供します(1 回のサンプラー呼び出しで 1 つの num_frames ウィンドウを編集するシングルチャンク方式)。
| ノード | 役割 |
|---|---|
Qwen-Video-Edit Loader | DiT、テキストエンコーダー、VAE、微調整チェックポイントを読み込む |
Qwen-Video-Edit Sampler (one chunk) | フレームチャンクを編集:prompt、num_frames、max_pixels、steps、cfg_scale、seed |
Wan2.2 Enhance (Ditto) | 必須のノイズ除去強化。wan22_ckpt_dir を設定 |
チェックポイント
微調整済みチェックポイントはすべて Hugging Face で公開され、推奨版は ModelScope にもミラーされています。ディレクトリ名は訓練サブセット(Ditto-1M)と対応フレーム数を表します。
| チェックポイント | 訓練データ | フレーム数 | 最大ピクセル |
|---|---|---|---|
360P/step-30000 ⭐ | global + local | 45 | 245760 |
480P/global_45/step-6000 | global | 45 | 399360 |
480P/local_45/step-11000 | local | 45 | 399360 |
480P/sim2real_45/step-7000 | sim2real | 45 | 399360 |
480P/global_local_81/step-6500 ⭐ | global + local | 81 | 399360 |
720P/global_local_45/step-3500 | global + local | 45 | 921600 |
「シーンをデジタル水墨画に変換して」— プロジェクトページのギャラリーより編集結果。
利用方法
Qwen-Video-Edit は ComfyUI カスタムノードパックとして提供されます。yunpeng1998/Qwen-Video-Edit を ComfyUI/custom_nodes/ にクローンし、依存関係と ComfyUI-VideoHelperSuite をインストールして、サンプルワークフロー(comfyui_workflows/qwen_video_edit_chunk.json)を読み込みます。初回実行時には約 55GB のベース重み(Qwen-Image-Edit DiT、テキストエンコーダー、Wan 2.1 VAE)がダウンロードされます。Wan2.2 強化ステージには追加で Wan-AI/Wan2.2-T2V-A14B が必要です。チェックポイントの latent_mode / pe_mode / zero_cond_t は読み込むチェックポイントと一致させる必要があります。推奨チェックポイントには ModelScope ミラーがあります。
コメント
GitHubでサインインしてディスカッションに参加しましょう。