MAGI-2 Preview : le modèle audio-vidéo open source de 114B de Sand.ai
Sand.ai publie MAGI-2 Preview : un MoE de 114B qui transforme texte ou images en vidéos de 10 secondes avec audio synchronisé, en n'activant que 6B paramètres par jeton.
Sand.ai a publié MAGI-2 Preview le 5 août, un modèle open source à mélange d'experts (MoE) de 114B de paramètres qui génère des vidéos de 10 secondes avec audio synchronisé à partir d'une invite texte ou d'une invite accompagnée d'une image fixe. Les poids, le code d'inférence et un rapport technique intitulé « Scaling Video Generation Models Efficiently » sont tous publics.
Visuel officiel de MAGI-2 Preview issu de l'annonce de Sand.ai
MAGI-2 fait suite à MAGI-1, le modèle vidéo autorégressif de Sand.ai datant d'avril 2025. MAGI-1 étudiait comment la vidéo devait être générée ; MAGI-2 se demande comment un modèle de génération vidéo doit passer à l'échelle, et la version d'aperçu valide que son architecture, son système d'entraînement et son pipeline de données peuvent évoluer ensemble au niveau 100B.
Un modèle pour la vidéo, l'audio et le texte
MAGI-2 conserve une conception à flux unique : les jetons de texte, de vidéo et d'audio sont concaténés en une séquence unifiée et traités par le même backbone Transformer. Au lieu de laisser les modalités interagir uniquement via des interfaces d'attention croisée étroites, le langage, le mouvement des lèvres, le mouvement du corps, le son et le rythme de la caméra échangent des informations dans tout le modèle. Le modèle génère à la fois les visuels et le son en une seule passe, puis multiplexe la piste audio dans le fichier vidéo de sortie.
| Fonctionnalité | Détail |
|---|---|
| Entrées | Invite texte (T2V), ou texte + image fixe (I2V) |
| Sortie | Vidéo de 10 secondes avec audio synchronisé (la seule durée prise en charge) |
| Génération | Deux étapes : étape d'aperçu à 512×896, étape du refiner avec mise à l'échelle jusqu'à 1088×1920 |
| Invites | Invites structurées longues ; le dépôt fournit des invites système pour l'amélioration des invites basée sur LLM |
Vidéo de démonstration du site officiel de Sand.ai
Le lot de démonstration officiel exécute les mêmes invites que les exemples T2V et I2V, en utilisant, comme entrées d'image, des images fixes telles que celles-ci :
![]() | ![]() |
|---|---|
| Exemple d'image fixe du lot de démonstration officiel | Exemple d'image fixe du lot de démonstration officiel |
MagiMoE : 114B de paramètres, ~6B actifs par jeton
L'architecture combine un schéma de routage latent multi-têtes avec des experts ultra-granulaires pour découpler la capacité totale du coût de calcul par jeton. La représentation de chaque jeton est divisée en 12 têtes latentes de 256 dimensions ; chaque tête possède son propre routeur et sélectionne ses 6 meilleurs experts (top-6) parmi un pool de 256 experts étroits. Chaque couche creuse contient donc 3 072 unités expertes locales à chaque tête, dont seulement 72 sont activées par jeton.
| Composant | Configuration |
|---|---|
| Backbone | 40 couches Transformer (36 sparses, 4 couches limites denses) |
| Largeur du modèle | 3 072 |
| Représentation routée | 12 têtes × 256 dimensions |
| Pool d'experts | 256 experts par tête, top-6 actifs |
| FFN de l'expert | 256 → 1 280 → 256, SwiGLU fusionné |
Vue d'ensemble de l'architecture et des systèmes du rapport technique MAGI-2 Preview
Head Parallel maintient des communications inter-périphériques régulières : les activations sont distribuées le long de la dimension des têtes avec des formes statiquement connues, de sorte que les tampons sont préalloués et que le routage dynamique est confiné à l'intérieur de chaque propriétaire de tête. Le système d'entraînement fait correspondre l'échange d'activations des têtes à InfiniBand entre les nœuds et le re-sharding des états d'experts à NVLink au sein des nœuds, les projets associés MagiCompiler et MagiAttention prenant en charge les kernels et l'attention. Côté données, le rapport décrit un passage d'une curation centrée sur le filtrage à une production de données à haut débit avec une annotation multimodale précise.
Disponibilité
L'inférence s'exécute via le pipeline Python officiel (torchrun avec une image Docker fournie) et nécessite 8 GPU NVIDIA Hopper. Il n'existe actuellement aucun nœud personnalisé ComfyUI pour MAGI-2. L'ensemble complet des checkpoints fait environ 307 Go sur Hugging Face : un transformer d'étape d'aperçu de 228 Go, un refiner de 14 Go, l'encodeur de texte Qwen3.5-27B (56 Go), le VAE vidéo Wan2.2, le VAE audio Stable Audio Open 1.0 et un décodeur VAE turbo distillé utilisé par défaut.
- Poids : sand-ai/MAGI-2-preview
- Code : SandAI-org/MAGI-2-preview
- Rapport technique : MAGI-2 Preview: Scaling Video Generation Models Efficiently


Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.