MiniMax H3 Character Swap LoRA: 参照動画の人物をキャラクター画像で入れ替え

ComfyUI Wikinews

Akatz LabsのMiniMax H3 Ref2VA向けキャラクタースワップLoRAは、参照動画内の1人の人物をキャラクター画像やキャラクターシートで置き換えます。重みとデータセットも公開されています。

MiniMax-H3-Character-Swap-LoRA は MiniMax H3 Ref2VA 向けのキャラクター置換アダプターです。参照動画とキャラクター画像(または完全なキャラクターシート)を入力すると、その1人の人物だけを参照キャラクターに入れ替え、シーン、カメラ、小道具、その他の人物はすべてそのまま保持します。Akatz Labsは9月25日、最終的な1,000ステップのcheckpointを、その背後にあるデータセットとトレーニング設定とともに公開しました。
Source video frameCharacter sheet referenceEdited target
ソース動画のフレームキャラクターシートの参照データセットのターゲット: 入れ替えられたキャラクター

公開データセットからのトレーニング例。ソースフレーム、キャラクターシート、そしてLoRAが生成するよう学習した編集済みターゲットを示しています。出典: H3 Character Swap v1。

このタスクは単なるidentity転送よりも広範です。H3 FaceSwap LoRA はクリップ内に既にある演技に顔を載せ替えるだけですが、このアダプターは衣装やレンダリング媒体を含む置換キャラクター全体をコピーし、同時にソースシーンの媒体も保持します。これによりクロススタイルのスワップが可能になります。イラスト調のキャラクターを実写映像に投入しても、そのイラスト調の見た目は維持され、94件のトレーニング編集のうち34件はまさにその方法で作られています。

データセットの内容

Akatz Labsは、重みと同時に公開された参照条件付きデータセット H3 Character Swap v1 でアダプターをトレーニングしました:

  • 134件の例: 94件のキャラクタースワップ編集と40件の保持クリップ。トレーニングには76件の編集と32件のクリップを使用し、18件の編集と8件のクリップをホールドアウトしました。
  • 編集はそれぞれ1枚の静止画像として構成されています。 シーンは5フレームの静止動画(<Video 1>)として提供され、置換対象はキャラクター画像またはシート(<Picture 1>)として渡され、各ペアには Swap the man in the purple shirt in <Video 1> with the character in <Picture 1>. のような短いターゲティング指示が付きます。
  • クロススタイルとシートのカバレッジ。 34件の編集がレンダリングスタイル間のスワップで、20件が完全なキャラクターシートを使用しており、ポートレート、スクエア、ランドスケープのシートは元のアスペクト比のまま保持されています。
  • 正則化クリップは明示的な保持例です。 同じ動画をコントロールとターゲットの両方に使用し、キャプションは Keep <Video 1> unchanged. としています。
  • 一度に1キャラクター。 複数キャラクターの置換はトレーニングターゲットでは教師あり学習されていません。

アダプター自体はrank 16のLoRAで、148 MB、Comfy-Org/MiniMax-H3 のpruned INT8 Ref2VAベース上でOstrisトレーニングアシスタントを用いて1,000更新分トレーニングされています。公開されているのは最終checkpointのみで、トレーニングランチャーと実行設定はリポジトリ内の training/ 以下に含まれています。

その他の例

Source video framePortrait character referenceEdited target
ソース動画のフレームポートレートのキャラクター参照データセットのターゲット: 入れ替えられたキャラクター

2つ目のトレーニングペア。こちらはシートではなくポートレート参照を条件としています。

得意なことと、破綻する箇所

作者自身によるベースモデルとの比較は限定的なものですが、ダウンロード前に読む価値があります:

  • シーン保持が改善。 並べて比較したレビューでは、アダプターはベースモデルよりも背景とシーン構造をソースに近い形で保持しましたが、作者はこれらのレビューをベンチマークではなく定性的なものと位置づけています。
  • 長いクリップではドリフトする。 長い時間幅ではフレーミング、配置、ソースのタイミングがずれていき、ハードカットが編集ではなく緩やかな位置調整に劣化することがあります。
  • 表情は不安定。 クローズアップの顔の表情は元の演技に従わないことが多く、より強い表情指示を与えるとスワップ自体が抑制されることもありました。
  • ショートクリップが最適。 約4〜5秒の連続ショットは、作者の14秒の試行よりも良好に保たれましたが、正確な最大再生時間は確立されていません。
  • トリガーワードなし。 ターゲティングはプロンプトから行い、カードにはプロンプトの文言が厳密なソース整合を保証するものではないと明記されています。

Banodocoのテスターも同じ壁にぶつかりました。CharlieはハイブリッドFL2VA/Ref2VA H3モデルでアダプターを使った10秒のテストを実行し、約5秒までは保つものの、15秒の試行ではぼやけたフレームになったと報告しています。また別のテスターは、元の人物のポーズと動作をプロンプトで記述しなければ、スワップがその動きをコピーしないと指摘しています。

ドリフトの原因は構造的なものです。すべての編集ターゲットが静止画像であったため、モデルは時間を通じて演技を維持する方法を示す動きのあるキャラクタースワップのターゲットを一度も見ていません。Akatz Labsはこの診断を携えてBanodocoの計算資源グラントプログラムに申請し、表情、カット、オクルージョン、より長いシーケンスをカバーする12〜24件の動画ペアの撮影、および現在の参照条件付けと明示的に整列されたソース/ターゲット潜在位置との比較のために、40 H100時間の承認を得ました。

ComfyUIでの実行

このアダプターはノード依存関係のない単一のmodel-only LoRAです:

  1. h3_character_swap_pro4500_1000.safetensors を ComfyUI/models/loras/ にダウンロードします。
  2. MiniMax H3 Ref2VAワークフローを構築または開き、pruned INT8 Ref2VAベース、そのテキストエンコーダー、H3の動画および音声VAEを指定します。
  3. model-only LoRAローダーでLoRAを strength 1.0 で適用します。
  4. 保持したいクリップを <Video 1>、置換キャラクターを <Picture 1> としてロードし、プロンプトで対象人物を指定します。例えば:
Replace only the man in the purple shirt in <Video 1> with the character in <Picture 1>.
Keep the replacement character's identity, outfit, and art style from <Picture 1>.
Preserve the source video's camera, background, lighting, objects, and all other people.
Match the target person's position, scale, pose, and movement.
Do not show the reference sheet or its background.

カードでは、H3がサポートするフレームグリッドで24 fpsとすること、そして長いショットよりも短い連続ショットを推奨しています。また、このアダプターは動作にTurbo LoRA、Spectrum、Sol attentionを必要とせず、8ステップのTurbo LoRAと組み合わせるのは互換性の主張ではなく評価上の選択であったと述べています。

入手方法

h3_character_swap_pro4500_1000.safetensors をダウンロード (148 MB)

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
MiniMax H3 Character Swap LoRA: 参照動画の人物をキャラクター画像で入れ替え | ComfyUI Wiki