MAGI-2 Preview : le modèle audio-vidéo open source de 114B de Sand.ai

ComfyUI Wikinews

Sand.ai publie MAGI-2 Preview : un MoE de 114B qui transforme texte ou images en vidéos de 10 secondes avec audio synchronisé, en n'activant que 6B paramètres par jeton.

Sand.ai a publié MAGI-2 Preview le 5 août, un modèle open source à mélange d'experts (MoE) de 114B de paramètres qui génère des vidéos de 10 secondes avec audio synchronisé à partir d'une invite texte ou d'une invite accompagnée d'une image fixe. Les poids, le code d'inférence et un rapport technique intitulé « Scaling Video Generation Models Efficiently » sont tous publics.

Visuel officiel de MAGI-2 Preview

Visuel officiel de MAGI-2 Preview issu de l'annonce de Sand.ai

MAGI-2 fait suite à MAGI-1, le modèle vidéo autorégressif de Sand.ai datant d'avril 2025. MAGI-1 étudiait comment la vidéo devait être générée ; MAGI-2 se demande comment un modèle de génération vidéo doit passer à l'échelle, et la version d'aperçu valide que son architecture, son système d'entraînement et son pipeline de données peuvent évoluer ensemble au niveau 100B.

Un modèle pour la vidéo, l'audio et le texte

MAGI-2 conserve une conception à flux unique : les jetons de texte, de vidéo et d'audio sont concaténés en une séquence unifiée et traités par le même backbone Transformer. Au lieu de laisser les modalités interagir uniquement via des interfaces d'attention croisée étroites, le langage, le mouvement des lèvres, le mouvement du corps, le son et le rythme de la caméra échangent des informations dans tout le modèle. Le modèle génère à la fois les visuels et le son en une seule passe, puis multiplexe la piste audio dans le fichier vidéo de sortie.

FonctionnalitéDétail
EntréesInvite texte (T2V), ou texte + image fixe (I2V)
SortieVidéo de 10 secondes avec audio synchronisé (la seule durée prise en charge)
GénérationDeux étapes : étape d'aperçu à 512×896, étape du refiner avec mise à l'échelle jusqu'à 1088×1920
InvitesInvites structurées longues ; le dépôt fournit des invites système pour l'amélioration des invites basée sur LLM

Vidéo de démonstration du site officiel de Sand.ai

Le lot de démonstration officiel exécute les mêmes invites que les exemples T2V et I2V, en utilisant, comme entrées d'image, des images fixes telles que celles-ci :

Exemple de première image 1Exemple de première image 2
Exemple d'image fixe du lot de démonstration officielExemple d'image fixe du lot de démonstration officiel

MagiMoE : 114B de paramètres, ~6B actifs par jeton

L'architecture combine un schéma de routage latent multi-têtes avec des experts ultra-granulaires pour découpler la capacité totale du coût de calcul par jeton. La représentation de chaque jeton est divisée en 12 têtes latentes de 256 dimensions ; chaque tête possède son propre routeur et sélectionne ses 6 meilleurs experts (top-6) parmi un pool de 256 experts étroits. Chaque couche creuse contient donc 3 072 unités expertes locales à chaque tête, dont seulement 72 sont activées par jeton.

ComposantConfiguration
Backbone40 couches Transformer (36 sparses, 4 couches limites denses)
Largeur du modèle3 072
Représentation routée12 têtes × 256 dimensions
Pool d'experts256 experts par tête, top-6 actifs
FFN de l'expert256 → 1 280 → 256, SwiGLU fusionné
Figure d'architecture de MAGI-2

Vue d'ensemble de l'architecture et des systèmes du rapport technique MAGI-2 Preview

Head Parallel maintient des communications inter-périphériques régulières : les activations sont distribuées le long de la dimension des têtes avec des formes statiquement connues, de sorte que les tampons sont préalloués et que le routage dynamique est confiné à l'intérieur de chaque propriétaire de tête. Le système d'entraînement fait correspondre l'échange d'activations des têtes à InfiniBand entre les nœuds et le re-sharding des états d'experts à NVLink au sein des nœuds, les projets associés MagiCompiler et MagiAttention prenant en charge les kernels et l'attention. Côté données, le rapport décrit un passage d'une curation centrée sur le filtrage à une production de données à haut débit avec une annotation multimodale précise.

Disponibilité

L'inférence s'exécute via le pipeline Python officiel (torchrun avec une image Docker fournie) et nécessite 8 GPU NVIDIA Hopper. Il n'existe actuellement aucun nœud personnalisé ComfyUI pour MAGI-2. L'ensemble complet des checkpoints fait environ 307 Go sur Hugging Face : un transformer d'étape d'aperçu de 228 Go, un refiner de 14 Go, l'encodeur de texte Qwen3.5-27B (56 Go), le VAE vidéo Wan2.2, le VAE audio Stable Audio Open 1.0 et un décodeur VAE turbo distillé utilisé par défaut.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MAGI-2 Preview : le modèle audio-vidéo open source de 114B de Sand.ai | ComfyUI Wiki