AnyAngle: Qwen-Image 2.1 LoRAで任意のカメラアングルを実現
AnyAngleは、写真を任意のカメラアングルへ移動させるQwen-Image 2.1 LoRAです。ガウシアンスプラットや3Dモデルからシーンをレンダリングし、編集モデルにその視点を引き継がせます。
編集モデルにおけるプロンプトのみのアングル変更は、いくつかの固定された方位角と仰角に収まりがちで、さらに推し進めると画像が別の見た目へと流れてしまいます。AnyAngleは作業を分割します。ジオメトリが新しい視点を決め、編集モデルがその視点から元の画像がどう見えるべきかを決めます。
LoRAで行ったカメラアングルの変更。モデルカードより。
パイプライン
モデルカードは、この方法を単一のモデルではなく既存ツールの連鎖として提示しています。
- シーンを再構成する。 ソース画像はガウシアンスプラット(作者はTripo Splatを使用していますが、任意のスプラット生成器で動作すると記しています)またはTrellis2やPixal3Dによる3Dモデルになります。
- Blenderでカメラを動かす。 再構成したものをインポートし、カメラを追加して希望のアングルに設定し、そのビューの粗い画像をレンダリングします。
- Qwen-Image 2.1でアングルを転写する。 粗いレンダリングと元の画像を、AnyAngle LoRAと以下のプロンプトとともに編集モデルへ入力します。出力は新しい視点を採用しつつ、元の画像のスタイルとマテリアルを保ちます。
Change the camera angle from <image2> to <image1>.
モデルカードに図示された3ステップのパイプライン: ソース画像、新しいアングルからの粗いレンダリング、そして完成した編集結果。
モデルカードのグラフにおける接続方法: 元の画像と粗いレンダリングの両方が、LoRAを適用したQwen-Image 2.1編集パイプラインへ入力されます。
設定
カードは、LoRAをどこで動かすのが好ましいかについて具体的に述べています。
- LoRA強度 1.0。
- CFG 3.0、20ステップ以上で最高の結果が得られます。
- ターボLoRAを重ねて、絵コンテやショットプランニングのレイテンシを削減できますが、品質はわずかに低下します。
ウェイト自体はrank-24のアダプタで、bf16で約120 MB、キーはdiffusion_model.*として配置されています。これはComfyUI自身のLoRAローダーが想定する命名なので、変換手順なしで読み込めます。
トレーニング
データセットは、スタイルの多様性を狙って選ばれた実際のBlenderレンダリングと、合成ペア(元の画像と、異なるカメラアングルで対応するフレーム)を組み合わせています。アンカーとターゲットが同じシーンのレンダリングであるため、ペアはハルシネーションではなく幾何学的に一貫しており、これが大きなアングル変更を通じてスタイルを揃え続ける鍵となっています。イラストやスケッチのスタイルをカバーするため、作者はMiniMax H3による画像から動画へのオービットレンダリング(フレーム内のすべてが静止したままカメラだけが動く)を使用し、その後数千ステップのトレーニングを行いました。
失敗するケース
結果は再構成の品質次第です。スプラットや3Dモデルが空間的に誤っている、または粗すぎる場合、オブジェクトが誤った位置に置かれたり、低解像度の画像では顔が崩れたりすることがあります。カードの例では、まさにその理由でテーブルとポニーテールが誤った配置になっています。推奨される修正は、再構成の配置を修正するか、より良いスプラットから始めることです。新しい3Dおよびワールド生成器がこのステップを改善し続けることが期待されています。
入手方法
- LoRAウェイト、方法、例: lilylilith/QI_2.1_AnyAngle
- ベースモデル: Qwen/Qwen-Image-2.1。ComfyUIの公式Qwen Image 2.1編集ワークフローを通じて読み込みます
コメント
GitHubでサインインしてディスカッションに参加しましょう。