ComfyUI向けMiniMax H3 360 Orbit LoRA: 1枚の写真から完全な360度オービットを生成
MiniMax H3 FL2VA用のコミュニティLoRAが、1枚の写真からカメラが360度を一周して最初のフレームに戻る動画を生成します。ComfyUIでの推奨設定も解説します。
4つの独立したオービット。いずれも1枚の写真を最初と最後のキーフレームとして生成。ソース: MiniMax-H3-360-Orbit-LoRA。
このLoRAが行うこと
MiniMax H3 には2つの動画生成パスがあり、このアダプターはその間のギャップを埋めます。参照から動画は入力画像を緩やかな外観の参照として扱うため、クリップは既知のフレームで終わらず、2つのクリップをきれいにつなげることもできません。最初と最後のフレーム生成は両端をピン留めするためつなぎ目は正確になりますが、初期状態では最初と最後のフレームが同じ画像だとほとんど動きません。モデルがそのリクエストを静止画として解釈するためです。
このアダプターは代わりに、モデルへ幾何学的に一貫した本物のオービットを学習させます。シーンは固定されていると宣言され、動くのはカメラだけです。終了フレームが開始フレームにピン留めされているため、動きはループとして閉じます。
1枚の写真からレンダリングされたオービット。同じ画像を最初と最後のキーフレームとして使用。
ベースモデルとの比較
以下の各比較では、同一のシード、プロンプト、解像度、ステップ数で同じ入力を3回レンダリングしています。左から右へ: 最初のフレームのみを与えたベースモデル、最初と最後のフレームを与えたベースモデル、そして最初と最後のフレームを与えたベースモデル+このLoRAです。
スケートのシーン: ベースモデルは冒頭の視点から離れていくか停止してしまう一方、LoRAはオービットを完遂して最初のフレームへ戻ります。
立ち姿の人物をめぐる、同じ3者比較。
上記の3者比較のフル解像度MP4。
ベースモデルのパネルを並べずに、LoRAのみを表示したもの。
プロンプト
作者はこのプロンプトをそのまま使用することを求めています:
One frozen instant. Only the camera moves. In a continuous 360 orbit. Preserve every person and object in exactly the same world position, orientation, shape and pose throughout the shot. Airborne objects remain suspended at the captured height and angle: no wobbling, shaking, spinning, drifting, falling or continued action. Keep faces, hands, clothing, liquids and the background motionless while retaining their natural appearance. Camera parallax is the only source of apparent movement. No cuts, zoom, morphing or added objects.推奨設定
| 設定 | 値 |
|---|---|
| ベースの重み | MiniMax H3 FL2VA pruned、Comfy-Org/MiniMax-H3 の INT8 ConvRot 再パック |
| キーフレーム | 完全な360度ループにするには、同じ画像を最初および最後のフレームとして使用 |
| 解像度 | 768 × 768 |
| フレーム数 | 73 (24 fps で約3秒) |
| ステップ | 28 |
| ガイダンス | なし。MiniMax H3 はガイダンス蒸留モデルなので、CFG もネガティブプロンプトもありません |
| LoRA強度 | 1.0 |
| 音声 | オフ |
ComfyUIでの実行
このアダプターは ComfyUI の命名 (diffusion_model.* キー) に従った単一の model-only LoRA なので、カスタムノードは不要です:
minimax_h3_flf2v_lora_v1.safetensorsをComfyUI/models/loras/にダウンロードします。- MiniMax H3 の最初と最後のフレーム用ワークフローを開き、pruned INT8 FL2VA ベースとそのテキストエンコーダー、H3 の動画および音声 VAE を指定します。
- model-only LoRA ローダーで LoRA を強度 1.0 で適用します。
- 1枚の画像を両方のキーフレームスロットに読み込み、上記のプロンプトをそのまま貼り付けます。
モデルカードには、この LoRA が ostris/ai-toolkit とその minimax_h3 拡張を用いてトレーニングおよびテストされたこと、またトレーニング中に使用されたトレーニングアダプターは推論時には不要であることが記載されています。
トレーニング方法
データセットは意図的に単一の内容へ絞られています。すべてのクリップが LoRA に学習させたい動きだけを示し、それ以外を含まないため、モデルは被写体が動くところを一度も見ません:
- 手作業で選んだ人物 Gaussian splat をめぐる28のオービットレンダリング。 スプラットは静的な3Dシーンなので、すべてのフレームは構造上必ず幾何学的に一貫しており、フレーム間で変化するのはカメラだけです。
- クリップ形式: 768 × 768、73フレーム、24 fps、すべてのクリップで1つのキャプション (上記のプロンプト)、キャプションドロップアウト 0.05、音声なし。
- アダプター: rank 16、alpha 16、
adaln_projを除くすべての transformer リニアレイヤーに適用、合計208モジュール。 - トレーニング: 3,000ステップ (約107エポック)、バッチサイズ 1、AdamW 8-bit、lr 1e-4、bf16 とグラディエントチェックポインティング、フローマッチングのシフトされたタイムステップ、MSE損失。NVIDIA A100 80 GB 1台で10時間24分、1ステップあたり約12.5秒。
制限事項
作者はこのリリースの適用範囲がどれほど狭いかを明言しています:
- ドメインが狭い。 トレーニングには、73フレームの人物中心の正方形クリップを28本使用しました。その他の被写体、その他のアスペクト比、その他のクリップ長は未検証です。
- 小さな動きが残ることがある。 シーンは固定されているはずですが、微妙な動き、特にまばたきが現れることがあります。
入手先
- LoRA の重み: pablodawson/MiniMax-H3-360-Orbit-LoRA
- ベースモデルの再パック: Comfy-Org/MiniMax-H3
- トレーニングツール: ostris/ai-toolkit
コメント
GitHubでサインインしてディスカッションに参加しましょう。