MAGI-2 Preview:Sand.aiのオープンソース114Bオーディオ・ビデオモデル
Sand.aiがMAGI-2 Previewをオープンソース化。テキストまたは画像から同期オーディオ付きの10秒ビデオを生成する114BパラメータのMoEモデルで、トークンあたりわずか6Bパラメータのみをアクティブ化します。
Sand.ai は8月5日、MAGI-2 Preview をリリースしました。これは、テキストプロンプトまたはプロンプトと静止画像から同期オーディオ付きの10秒ビデオを生成する、オープンソースの114BパラメータのMoE(mixture-of-experts)モデルです。重み、推論コード、および「Scaling Video Generation Models Efficiently」と題する技術報告はすべて公開されています。
Sand.aiの発表で公開されたMAGI-2 Preview公式ビジュアル
MAGI-2 は、Sand.ai が2025年4月にリリースした自己回帰ビデオモデル MAGI-1 の後継です。MAGI-1 はビデオをどのように生成すべきかを研究しました。一方、MAGI-2 はビデオ生成モデルをどのようにスケールさせるかを問いかけています。このプレビューリリースは、そのアーキテクチャ、トレーニングシステム、データpipelineが100Bレベルで一体となってスケールできることを実証しています。
ビデオ・オーディオ・テキストのための単一モデル
MAGI-2 は単一ストリーム設計を採用しています。テキスト、ビデオ、オーディオのトークンを1つの統合シーケンスに連結し、同じ Transformer バックボーンで処理します。モダリティが狭いクロスアテンションインターフェースでのみ相互作用するのではなく、言語、口の動き、身体の動き、サウンド、カメラのリズムがモデル全体で情報を交換します。モデルはビジュアルとサウンドの両方を1回のパスで生成し、その後オーディオトラックを出力ビデオファイルに多重化します。
| 機能 | 詳細 |
|---|---|
| 入力 | テキストプロンプト(T2V)、またはテキスト+静止画像(I2V) |
| 出力 | 同期オーディオ付き10秒ビデオ(サポートされる唯一の再生時間) |
| 生成 | 2段階:512×896のプレビュー段階と、1088×1920へアップスケーリングするリファイナー段階 |
| プロンプト | 長い構造化キャプション。リポジトリにはLLMベースのプロンプト拡張用のシステムプロンプトが同梱されています。 |
<video controls width="100%" poster="https://s.comfyui-wiki.com
コメント
GitHubでサインインしてディスカッションに参加しましょう。