MAGI-2 Preview: modelo abierto de audio y vídeo de 114B de Sand.ai
Sand.ai publica MAGI-2 Preview: un MoE de 114B que convierte texto o imágenes en vídeos de 10 segundos con audio sincronizado, activando solo 6B parámetros por token.
Sand.ai lanzó MAGI-2 Preview el 5 de agosto, un modelo de mezcla de expertos (MoE) de código abierto con 114B de parámetros que genera vídeos de 10 segundos con audio sincronizado a partir de un prompt de texto o un prompt más una imagen fija. Los pesos, el código de inferencia y un informe técnico titulado "Scaling Video Generation Models Efficiently" son públicos.
Visual oficial de MAGI-2 Preview del anuncio de Sand.ai
MAGI-2 es la continuación de MAGI-1, el modelo de vídeo autorregresivo de Sand.ai de abril de 2025. MAGI-1 estudió cómo se debe generar el vídeo; MAGI-2 pregunta cómo debe escalar un modelo de generación de vídeo, y la versión preliminar valida que su arquitectura, sistema de entrenamiento y pipeline de datos pueden escalar juntos a nivel de 100B.
Un Solo Modelo para Vídeo, Audio y Texto
MAGI-2 mantiene un diseño de flujo único: los tokens de texto, vídeo y audio se concatenan en una secuencia unificada y se procesan con el mismo backbone Transformer. En lugar de permitir que las modalidades interactúen solo a través de interfaces estrechas de atención cruzada, el idioma, el movimiento de labios, el movimiento corporal, el sonido y el ritmo de cámara intercambian información en todo el modelo. El modelo genera tanto los visuales como el sonido en una sola pasada y luego multiplexa la pista de audio en el archivo de vídeo de salida.
| Capacidad | Detalle |
|---|---|
| Entradas | Prompt de texto (T2V), o texto + imagen fija (I2V) |
| Salida | Vídeo de 10 segundos con audio sincronizado (la única duración compatible) |
| Generación | Dos etapas: etapa de vista previa a 512×896, etapa de refinamiento con upscaling a 1088×1920 |
| Prompting | Descripciones estructuradas largas; el repositorio incluye system prompts para la mejora de prompts basada en LLM |
Vídeo de demostración del sitio oficial de Sand.ai
El lote de demostración oficial ejecuta los mismos prompts que las entradas T2V y I2V, usando imágenes fijas como estas como entradas de imagen:
![]() | ![]() |
|---|---|
| Imagen fija de muestra del lote de demostración oficial | Imagen fija de muestra del lote de demostración oficial |
MagiMoE: 114B de Parámetros, ~6B Activos por Token
La arquitectura combina un esquema de enrutamiento latent multi-head con expertos de grano ultrafino para desacoplar la capacidad total del cómputo por token. La representación de cada token se divide en 12 latent heads de 256 dimensiones; cada latent head tiene su propio router y selecciona sus top-6 expertos de un grupo de 256 expertos estrechos. Cada capa dispersa contiene por tanto 3,072 unidades de experto locales por head, de las cuales solo se activan 72 por token.
| Componente | Configuración |
|---|---|
| Backbone | 40 capas Transformer (36 dispersas, 4 capas límite densas) |
| Ancho del modelo | 3,072 |
| Representación enrutada | 12 latent heads × 256 dimensiones |
| Grupo de expertos | 256 expertos por head, top-6 activos |
| FFN de experto | 256 → 1,280 → 256, SwiGLU fusionado |
Resumen de arquitectura y sistemas del informe técnico de MAGI-2 Preview
Head Parallel mantiene regular la comunicación entre dispositivos: las activaciones se envían a lo largo de la dimensión de los heads con formas estáticamente conocidas, de modo que los buffers se preasignan y el enrutamiento dinámico queda confinado dentro del propietario de cada head. El sistema de entrenamiento asigna el intercambio de activaciones de heads a InfiniBand entre nodos y el resharding del estado de los expertos a NVLink dentro de los nodos, con los proyectos complementarios MagiCompiler y MagiAttention encargándose de los kernels y la atención. En el lado de los datos, el informe describe un cambio desde una curación centrada en el filtrado hacia una producción de datos de alto rendimiento con anotación multimodal precisa.
Disponibilidad
La inferencia se ejecuta a través del pipeline oficial de Python (torchrun con una imagen de Docker incluida) y requiere 8 GPU NVIDIA Hopper; no hay Nodos Personalizados de ComfyUI para MAGI-2 por el momento. El conjunto completo de checkpoints pesa aproximadamente 307 GB en Hugging Face: un transformer de la etapa de vista previa de 228 GB, un refiner de 14 GB, el codificador de texto Qwen3.5-27B (56 GB), el VAE de vídeo Wan2.2, el VAE de audio Stable Audio Open 1.0 y un decodificador VAE turbo destilado que se usa por defecto.
- Pesos: sand-ai/MAGI-2-preview
- Código: SandAI-org/MAGI-2-preview
- Informe técnico: MAGI-2 Preview: Scaling Video Generation Models Efficiently


Comentarios
Inicia sesión con GitHub para unirte a la conversación.