Qwen-Image-2.1 Next-Scene LoRA: 1枚の画像から連鎖するストーリーボードを生成

ComfyUI Wikinews

akhaliqのNext-Scene LoRAは、Qwen-Image 2.1に1枚のフレームから次の演出カットを描画させ、ComfyUIのLoRAノードを通じてストーリーボードへ連鎖させる使い方を解説します。

Qwen-Image-2.1-Next-Scene-LoRA は、Qwen-Image 2.1 に1つの特定の編集を学習させるrank-64のアダプターです。現在のフレームと監督スタイルの指示が与えられると、手元のフレームを編集するのではなく、次のショットを生成します。世界観、キャラクター、スタイルをそのままに、カメラの動き、明かされる要素、ライティングの変化が適用され、その出力を次の入力として戻すことでストーリーボードを構築できます。
1枚の写真から4ホップ、各フレームは前のフレームから生成

1枚の写真から4つの演出ショット。各フレームは前の出力を新しい指示とともにフィードバックしたもので、推奨のstep 2,500チェックポイントとstrength 0.7で生成されています。

Qwen-Image 2.1に追加される機能

next-scene形式は lovis93/next-scene-qwen-image-lora-2509 に由来し、Qwen-Image 2509の編集モデルで313,000ダウンロードを記録しています。本作はそれを現在のベースモデルへ移植したもので、その能力がまだ存在しないQwen-Image 2.1上でネイティブに再トレーニングされています。カメラの位置を制御するakhaliqの以前のMultiple-Angles LoRAと組み合わせて使え、Next-Sceneは次に物語がどこへ向かうかを制御します。

プロンプトは Next Scene: で始まり、カメラの動きを先頭に書きます。たとえば「Next Scene: The camera pulls back to a sweeping aerial view, revealing the fleet behind the cliffs」のように指定します。

Next Scene: The camera tracks forward and tilts down as rain begins to streak the lens.
Next Scene: Cut to a low-angle shot; sunlight breaks through the clouds behind her.
Next Scene: The camera pans right, revealing the fleet massing behind the ridge.

連鎖と、実測に基づくレシピ

各出力を次の入力としてフィードバックすることが、このアダプターをストーリーボードツールに変えます。ただし作者は失敗モードを推測せず、実際に計測しました。strength 0.9での素朴な連鎖ではフィルムグレインが蓄積し、ホップ3~4までに目に見える色ノイズになります。クリーンな連鎖のための検証済みレシピは、strength 0.7以下に加えて、連鎖させる各入力に0.5ピクセルのガウスぼかしをかけることです。これによりグレイン増幅のフィードバックループが断ち切られます。上記の4ホップの例は、まさにこの方法でレンダリングされています。

1ホップ目2ホップ目
ホップ1: カメラが後退しワイドショットになるホップ2: 右へパン、宇宙飛行士がレゴリスを跳ねていく
3ホップ目4ホップ目
ホップ3: 宇宙飛行士が敬礼するローアングルショットへカットホップ4: 金色のバイザーに寄り、そこに月着陸船が映り込む

どのチェックポイントを使うか

リポジトリには変換済みの3つのチェックポイントと、生のトレーニング出力が含まれています。

チェックポイント評価
next_scene_step2500.safetensors推奨。最終ステップで、diffusersのキーレイアウトに変換済み。構図と同一性を保ちながら最も強いシーン変換を行います。
next_scene_step1500.safetensorsよりソフトな代替版で、同一性への影響が穏やか。2,500が強すぎる場合に使用します。
next_scene_step1000.safetensors最も弱い変換で、主にトレーニングカーブの研究に有用です。
checkpoints/qwen21_next_scene_v1_*.safetensors生のai-toolkit形式。MLPキーはai-toolkitの融合命名を使用しており、diffusersはそれを黙ってスキップします。ai-toolkitまたは専用ローダー経由でのみ使用できます。

作者はまた、1つの嵐のプロンプトについてstep 1,000、1,500、2,500にわたるチェックポイントスイープを、LoRAなしのコントロール付きで公開しています。Qwen-Image 2.1は単体でも編集が得意なため、ベースモデルもすでに嵐を試みますが、谷全体に嵐の前線を広げつつ、探検家、遺跡、色調を保っているのはstep 2,500のセルです。

LoRAなしのコントロールを含む、トレーニングステップごとのチェックポイントスイープ

1つのシネマティックなスターター画像に、各チェックポイントで同じ嵐の指示を与えたもの。加えてLoRAなしのコントロール。

トレーニング方法

  • ベース: Qwen-Image 2.1、arch: qwen_image_2。
  • データ: 1,144組のシーン進行ペア。BlenderのオープンフィルムSintelとTears of Steel(CC-BY)の連続フレームを使用し、各フレームから次フレームへのペアに対してQwen3-VL-4Bが監督スタイルの「Next Scene: ...」指示としてキャプションを付与。生のペアとキャプション付きセットの両方が公開されています。
  • トレーニング: ostris/ai-toolkit、rank 64 / alpha 64、adamw8bit、学習率1e-4、weighted timesteps、caption dropout 0.05、512ピクセル、2,500ステップ、uint3量子化ベースをbf16で使用。

適用範囲と制限

このアダプターはシネマティックな映画のフレームでトレーニングされており、1本はアニメーション、1本は実写です。写真にも汎化しますが、最も得意なのはフィルム調のシーン、風景、状況説明ショットであり、静的なポートレートは設計上対象外です。トレーニングは512ピクセルで行われました。より大きなキャンバスでもこの挙動は引き継がれますが、トレーニングはされていません。250ステップごとのサンプルグリッドは checkpoints/samples/ に保存されており、TrackioダッシュボードとデモSpaceがモデルカードからリンクされています。

ComfyUIでの利用

推奨チェックポイントはすでに変換済みなので、あらゆるQwen-Image 2.1ワークフローにstrength 0.7~0.9のLoRAノードを通じて読み込めます。画像は編集入力または参照入力として渡します。このアダプター専用のワークフローファイルはありません。ComfyUIで使用するのはルート直下の next_scene_step*.safetensors ファイルで、checkpoints/ 内のコピーはai-toolkit形式です。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Qwen-Image-2.1 Next-Scene LoRA: 1枚の画像から連鎖するストーリーボードを生成 | ComfyUI Wiki