MAGI-2 Preview:Sand.aiのオープンソース114Bオーディオ・ビデオモデル

ComfyUI Wikinews

Sand.aiがMAGI-2 Previewをオープンソース化。テキストまたは画像から同期オーディオ付きの10秒ビデオを生成する114BパラメータのMoEモデルで、トークンあたりわずか6Bパラメータのみをアクティブ化します。

Sand.ai は8月5日、MAGI-2 Preview をリリースしました。これは、テキストプロンプトまたはプロンプトと静止画像から同期オーディオ付きの10秒ビデオを生成する、オープンソースの114BパラメータのMoE(mixture-of-experts)モデルです。重み推論コード、および「Scaling Video Generation Models Efficiently」と題する技術報告はすべて公開されています。

MAGI-2 Previewの公式ビジュアル

Sand.aiの発表で公開されたMAGI-2 Preview公式ビジュアル

MAGI-2 は、Sand.ai が2025年4月にリリースした自己回帰ビデオモデル MAGI-1 の後継です。MAGI-1 はビデオをどのように生成すべきかを研究しました。一方、MAGI-2 はビデオ生成モデルをどのようにスケールさせるかを問いかけています。このプレビューリリースは、そのアーキテクチャ、トレーニングシステム、データpipelineが100Bレベルで一体となってスケールできることを実証しています。

ビデオ・オーディオ・テキストのための単一モデル

MAGI-2 は単一ストリーム設計を採用しています。テキスト、ビデオ、オーディオのトークンを1つの統合シーケンスに連結し、同じ Transformer バックボーンで処理します。モダリティが狭いクロスアテンションインターフェースでのみ相互作用するのではなく、言語、口の動き、身体の動き、サウンド、カメラのリズムがモデル全体で情報を交換します。モデルはビジュアルとサウンドの両方を1回のパスで生成し、その後オーディオトラックを出力ビデオファイルに多重化します。

機能詳細
入力テキストプロンプト(T2V)、またはテキスト+静止画像(I2V)
出力同期オーディオ付き10秒ビデオ(サポートされる唯一の再生時間)
生成2段階:512×896のプレビュー段階と、1088×1920へアップスケーリングするリファイナー段階
プロンプト長い構造化キャプション。リポジトリにはLLMベースのプロンプト拡張用のシステムプロンプトが同梱されています。

<video controls width="100%" poster="https://s.comfyui-wiki.com

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
MAGI-2 Preview:Sand.aiのオープンソース114Bオーディオ・ビデオモデル | ComfyUI Wiki