MAGI-2 Preview: открытая модель Sand.ai на 114B для видео и аудио
Sand.ai открыла MAGI-2 Preview: MoE-модель на 114B, превращающая текст или изображения в 10-секундные видео с синхронизированным аудио, активируя лишь 6B параметров на токен.
Sand.ai выпустила MAGI-2 Preview 5 августа: это открытая модель на 114B параметров, использующая архитектуру смеси экспертов (MoE), которая генерирует 10-секундные видео с синхронизированным аудио по текстовому запросу или по запросу с неподвижным изображением. Веса, код для вывода и технический отчет под названием «Scaling Video Generation Models Efficiently» находятся в открытом доступе.
Официальный визуал MAGI-2 Preview из анонса Sand.ai
MAGI-2 продолжает линию MAGI-1, авторегрессивной видеомодели Sand.ai, выпущенной в апреле 2025 года. MAGI-1 исследовала как следует генерировать видео; MAGI-2 задается вопросом как должна масштабироваться модель генерации видео, и выпуск предварительной версии подтверждает, что ее архитектура, система обучения и пайплайн данных могут масштабироваться вместе на уровне 100B.
Одна модель для видео, аудио и текста
MAGI-2 сохраняет архитектуру с единым потоком данных: токены текста, видео и аудио объединяются в единую последовательность и обрабатываются одной и той же основной сетью Transformer. Вместо того чтобы модальности взаимодействовали только через узкие интерфейсы перекрестного внимания, язык, движения губ, движения тела, звук и ритм камеры обмениваются информацией по всей модели. Модель генерирует и визуальные образы, и звук за один проход, а затем встраивает аудиодорожку в выходной видеофайл.
| Возможность | Детали |
|---|---|
| Входы | Текстовый запрос (T2V) или текст + неподвижное изображение (I2V) |
| Выход | 10-секундное видео с синхронизированным аудио (единственная поддерживаемая длительность) |
| Генерация | Двухэтапная: этап предпросмотра при разрешении 512×896, этап уточнения с увеличением разрешения до 1088×1920 |
| Промптинг | Длинные структурированные описания; в репозитории есть системные промпты для улучшения промптов на основе LLM |
Демо-видео с официального сайта Sand.ai
Официальный демонстрационный пакет запускает те же промпты, что и записи T2V и I2V, используя в качестве входных изображений такие стоп-кадры:
![]() | ![]() |
|---|---|
| Пример стоп-кадра из официального демонстрационного пакета | Пример стоп-кадра из официального демонстрационного пакета |
MagiMoE: 114B параметров, ~6B активных на токен
Архитектура сочетает схему многоголовой латентной маршрутизации с экспертами сверхмелкой гранулярности, чтобы отвязать общую емкость от вычислений на токен. Представление каждого токена разбивается на 12 латентных голов размерностью 256; каждая голова имеет собственный маршрутизатор и выбирает свои top-6 экспертов из пула, состоящего из 256 узких экспертов. Таким образом, каждый разреженный слой содержит 3072 экспертных блока, привязанных к своим головам, из которых на токен активируются только 72.
| Компонент | Конфигурация |
|---|---|
| Основной блок | 40 слоев Transformer (36 разреженных, 4 плотных граничных слоя) |
| Ширина модели | 3072 |
| Маршрутизируемое представление | 12 голов × 256 измерений |
| Пул экспертов | 256 экспертов на голову, активны top-6 |
| Экспертный FFN | 256 → 1280 → 256, fused SwiGLU |
Обзор архитектуры и систем из технического отчета MAGI-2 Preview
Head Parallel обеспечивает регулярную связь между устройствами: активации рассылаются по измерению голов с заранее известными формами, поэтому буферы выделяются заранее, а динамическая маршрутизация ограничена внутри владельца каждой головы. Система обучения сопоставляет обмен активациями голов с InfiniBand между узлами, а перешардирование состояния экспертов с NVLink внутри узлов; сопутствующие проекты MagiCompiler и MagiAttention отвечают за ядра и внимание. Что касается данных, в отчете описывается переход от курирования, основанного на фильтрации, к высокопроизводительному производству данных с точной мультимодальной аннотацией.
Доступность
Вывод выполняется через официальный пайплайн на Python (torchrun, с предоставляемым Docker-образом) и требует 8 GPU NVIDIA Hopper. Пользовательских нод ComfyUI для MAGI-2 на данный момент нет. Полный набор чекпоинтов на Hugging Face занимает около 307 ГБ: Transformer этапа предпросмотра на 228 ГБ, рефайнер на 14 ГБ, текстовый энкодер Qwen3.5-27B (56 ГБ), видео-VAE Wan2.2, аудио-VAE Stable Audio Open 1.0 и дистиллированный турбо-декодер VAE, используемый по умолчанию.
- Веса: sand-ai/MAGI-2-preview
- Код: SandAI-org/MAGI-2-preview
- Технический отчет: MAGI-2 Preview: Scaling Video Generation Models Efficiently


Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.