Qwen-Video-Edit: 指示ベースの動画編集、ComfyUI ノード対応

ComfyUI Wikinews

Qwen-Video-Edit は Qwen-Image-Edit の DiT を再利用して Wan 2.1 の動画潜在表現をテキスト指示で直接編集するモデル。公式 ComfyUI カスタムノードと 360P/480P/720P チェックポイントを提供する。

Qwen-Video-Edit は、Qwen-Image-Edit の DiT を再利用して Wan 2.1 の動画 VAE 潜在表現を直接編集する指示ベースの動画編集モデルで、動画事前学習済み Transformer を必要としません。最初のリリースは 8 月 14 日(コード、論文、360P チェックポイント)。8 月 20 日には公式 ComfyUI 対応と 480P・720P チェックポイントが追加されました。

この研究は Yunpeng Bai(テキサス大学オースティン校)、Yossi Gandelsman、Michaël Gharbi(Adobe)、Qixing Huang(テキサス大学オースティン校)によるもので、論文と、前後比較デモが豊富なプロジェクトページが公開されています。

長尺動画編集デモ

異なる指示でチャンク単位に編集した長尺動画のデモ:左がソース、右が編集結果。

仕組み

Qwen-Video-Edit は動画拡散 Transformer を適合させる代わりに、画像編集モデルに動画の潜在表現を直接扱わせます。

  • ウォームスタート投影 — 2 つの小さな学習可能な投影が Wan 2.1 の 16 チャンネル動画潜在表現を DiT のトークン空間に橋渡し。DiT 自身の入出力層から初期化されるため、静止画の埋め込みは Qwen 画像と同一になります
  • グリッド位置エンコーディング — 潜在フレームを仮想的な大きな画像のタイルとして配置し、画像モデルの事前分布に合わせます
  • プロンプト + フレームグリッドプレビュー — Qwen2.5-VL ブランチがソースフレームのプレビューと一緒に指示をエンコードします

凍結された Wan 2.1 VAE がエンコードとデコードを担い、任意の Wan 2.2 ノイズ除去強化ステージ(Ditto 由来)が編集後の潜在表現を仕上げます。

「動画をパステルカラーの童話絵本イラストに変換して」— プロジェクトページのギャラリーより編集結果。

ComfyUI ノード

このリポジトリは ComfyUI カスタムノードパックを兼ねており、QwenVideoEdit カテゴリに 3 つのノードを提供します(1 回のサンプラー呼び出しで 1 つの num_frames ウィンドウを編集するシングルチャンク方式)。

ノード役割
Qwen-Video-Edit LoaderDiT、テキストエンコーダー、VAE、微調整チェックポイントを読み込む
Qwen-Video-Edit Sampler (one chunk)フレームチャンクを編集:prompt、num_frames、max_pixels、steps、cfg_scale、seed
Wan2.2 Enhance (Ditto)必須のノイズ除去強化。wan22_ckpt_dir を設定
Qwen-Video-Edit ComfyUI ワークフローデモ

チェックポイント

微調整済みチェックポイントはすべて Hugging Face で公開され、推奨版は ModelScope にもミラーされています。ディレクトリ名は訓練サブセット(Ditto-1M)と対応フレーム数を表します。

チェックポイント訓練データフレーム数最大ピクセル
360P/step-30000global + local45245760
480P/global_45/step-6000global45399360
480P/local_45/step-11000local45399360
480P/sim2real_45/step-7000sim2real45399360
480P/global_local_81/step-6500global + local81399360
720P/global_local_45/step-3500global + local45921600

「シーンをデジタル水墨画に変換して」— プロジェクトページのギャラリーより編集結果。

利用方法

Qwen-Video-Edit は ComfyUI カスタムノードパックとして提供されます。yunpeng1998/Qwen-Video-EditComfyUI/custom_nodes/ にクローンし、依存関係と ComfyUI-VideoHelperSuite をインストールして、サンプルワークフロー(comfyui_workflows/qwen_video_edit_chunk.json)を読み込みます。初回実行時には約 55GB のベース重み(Qwen-Image-Edit DiT、テキストエンコーダー、Wan 2.1 VAE)がダウンロードされます。Wan2.2 強化ステージには追加で Wan-AI/Wan2.2-T2V-A14B が必要です。チェックポイントの latent_mode / pe_mode / zero_cond_t は読み込むチェックポイントと一致させる必要があります。推奨チェックポイントには ModelScope ミラーがあります。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Qwen-Video-Edit: 指示ベースの動画編集、ComfyUI ノード対応 | ComfyUI Wiki