Qwen-Image 2.1 Multiple-Angles LoRA: 任意の視点から被写体を再撮影するカメラ制御
AkhaliqのMultiple-Angles LoRAはQwen-Image 2.1にカメラ制御を追加します。写真を入力し、72通りの方位角と仰角のフレーミングから1つを選ぶだけで、ComfyUIで被写体を再撮影できます。
目線の高さでのゴールデンレトリバーの周回。12方位すべてのステップを、v2チェックポイントのstep 1,500で生成。
このアダプターが追加するもの
Qwen-Image 2.1は生成と編集を1つのモデルで処理しますが、カメラがどこに位置するかという概念を持っていません。「背中を見せて」とプロンプトしても、通常は被写体がほぼ元の位置に留まります。このLoRAは代わりにポーズ辞書を学習します。すべてのプロンプトはトリガー <mva> で始まり、その後に名前付きの方位角と仰角が続きます。モデルはシーンではなくカメラを動かします。
同じ周回をラベル付きストリップにしたもの。方位角ごとに1フレーム。
文法は短いです:
<mva> {azimuth}, {elevation}[ close-up]- 12方位角: 30度刻みで、前面ビューから両側面を経て背面ビューまで。
- 4つの仰角: 目線の高さ、やや高い位置(30度)、ハイアングル(60度)、真上からの俯瞰(90度)。
- すべての組み合わせに
close-upバリアントがあり、合計72通りの指定可能なフレーミング。 - ComfyUIまたはdiffusersでは、LoRA強度
0.8~1.0を推奨。
実写写真での動作
トレーニングセットはレンダリングされたオブジェクトですが、モデルカードには、モデルが一度も見たことのない一般の写真(Wikimedia Commonsのゴールデンレトリバー、猫、リンゴ)に対するホールドアウトテストが記載されています。強度1.0付近では、被写体は要求された視点へ回転し、シーンもおおむね維持されますが、トレーニング分布から離れた被写体では毛並みのような細部がぼやけます。
![]() | ![]() |
|---|---|
| 右前からの斜めビュー、目線の高さ | 背面ビュー、目線の高さ |
カードの経験則: まず強度1.0から始めます。再撮影がカメラを動かすのではなく参照写真をコピーする方向に流れる場合は、チェックポイントを切り替えるのではなく、強度を0.8に向けて下げてください。
v2での変更点
第2版が推奨のダウンロードです。トレーニングペアを5,028から13,328に増やし(キャラクターを優先したDome-Objaverseセットと、ライセンスでフィルタリングされたリグ付きキャラクター)、rankを32から64へ引き上げ、ベース精度をconvrot int8からbf16に切り替えて、重み付きタイムステップサンプリングを採用しています。
v1のstep 1,000とv2のstep 1,500を比較するキャラクター・ポーズシート。
<mva>文法とポーズ辞書はバージョン間で変わっていないため、v1向けに構築したワークフローはファイルを差し替えてもそのまま動作します。カードはv2ランのstep 1,500(rank 64、完全精度、checkpoints_v2/内で約319 MB)を推奨しています。v1のファイルはcheckpoints/に残っており、そこではstep 1,000が最適です。
ComfyUIでの実行
このアダプターは通常のLoRAなので、カスタムノードパックは不要です。.safetensorsをComfyUI/models/loras/に置き、Qwen-Image 2.1 diffusionモデル、そのテキストエンコーダー、対応するVAEとともに、スタンダードなLoRAローダーで読み込みます。カードは強度0.8~1.0を推奨しています。アダプター固有のサンプラーやCFG値はないため、ベースモデル自体の設定が適用されます。
ベンチマークの率直な内容
カードは144ケースのホールドアウトベンチマーク(未見のオブジェクト24個、それぞれ6ポーズ)を公開し、正解のドームレンダリングに対してCLIPの画像-画像コサイン類似度で採点しています。そしてそれを正直に報告しています。アダプター未適用のベースモデルの方が平均スコアはわずかに高い(0.857 対 0.832)のです。これは、この指標がカメラが動いたかどうかよりも、主に画像全体の類似度を測っているためです。著者らは、正しいプロトコルはポーズ検索精度であり、それにはさらにもう一度レンダリングパスが必要だと述べ、能力そのものの主要な証拠として、マッチさせたプロンプトによるA/B画像を読者に示しています。
入手方法
重み: akhaliq/Qwen-Image-2.1-Multiple-Angles-LoRA
ベースモデル: Qwen/Qwen-Image-2.1
トレーニングデータ(v2): akhaliq/qwen21-multiple-angles-train-v2
ベースファミリーページ: Qwen-Image 2.1


コメント
GitHubでサインインしてディスカッションに参加しましょう。