MAGI-2 Preview: открытая модель Sand.ai на 114B для видео и аудио

ComfyUI Wikinews

Sand.ai открыла MAGI-2 Preview: MoE-модель на 114B, превращающая текст или изображения в 10-секундные видео с синхронизированным аудио, активируя лишь 6B параметров на токен.

Sand.ai выпустила MAGI-2 Preview 5 августа: это открытая модель на 114B параметров, использующая архитектуру смеси экспертов (MoE), которая генерирует 10-секундные видео с синхронизированным аудио по текстовому запросу или по запросу с неподвижным изображением. Веса, код для вывода и технический отчет под названием «Scaling Video Generation Models Efficiently» находятся в открытом доступе.

Официальный визуал MAGI-2 Preview

Официальный визуал MAGI-2 Preview из анонса Sand.ai

MAGI-2 продолжает линию MAGI-1, авторегрессивной видеомодели Sand.ai, выпущенной в апреле 2025 года. MAGI-1 исследовала как следует генерировать видео; MAGI-2 задается вопросом как должна масштабироваться модель генерации видео, и выпуск предварительной версии подтверждает, что ее архитектура, система обучения и пайплайн данных могут масштабироваться вместе на уровне 100B.

Одна модель для видео, аудио и текста

MAGI-2 сохраняет архитектуру с единым потоком данных: токены текста, видео и аудио объединяются в единую последовательность и обрабатываются одной и той же основной сетью Transformer. Вместо того чтобы модальности взаимодействовали только через узкие интерфейсы перекрестного внимания, язык, движения губ, движения тела, звук и ритм камеры обмениваются информацией по всей модели. Модель генерирует и визуальные образы, и звук за один проход, а затем встраивает аудиодорожку в выходной видеофайл.

ВозможностьДетали
ВходыТекстовый запрос (T2V) или текст + неподвижное изображение (I2V)
Выход10-секундное видео с синхронизированным аудио (единственная поддерживаемая длительность)
ГенерацияДвухэтапная: этап предпросмотра при разрешении 512×896, этап уточнения с увеличением разрешения до 1088×1920
ПромптингДлинные структурированные описания; в репозитории есть системные промпты для улучшения промптов на основе LLM

Демо-видео с официального сайта Sand.ai

Официальный демонстрационный пакет запускает те же промпты, что и записи T2V и I2V, используя в качестве входных изображений такие стоп-кадры:

Пример первого кадра 1Пример первого кадра 2
Пример стоп-кадра из официального демонстрационного пакетаПример стоп-кадра из официального демонстрационного пакета

MagiMoE: 114B параметров, ~6B активных на токен

Архитектура сочетает схему многоголовой латентной маршрутизации с экспертами сверхмелкой гранулярности, чтобы отвязать общую емкость от вычислений на токен. Представление каждого токена разбивается на 12 латентных голов размерностью 256; каждая голова имеет собственный маршрутизатор и выбирает свои top-6 экспертов из пула, состоящего из 256 узких экспертов. Таким образом, каждый разреженный слой содержит 3072 экспертных блока, привязанных к своим головам, из которых на токен активируются только 72.

КомпонентКонфигурация
Основной блок40 слоев Transformer (36 разреженных, 4 плотных граничных слоя)
Ширина модели3072
Маршрутизируемое представление12 голов × 256 измерений
Пул экспертов256 экспертов на голову, активны top-6
Экспертный FFN256 → 1280 → 256, fused SwiGLU
Схема архитектуры MAGI-2

Обзор архитектуры и систем из технического отчета MAGI-2 Preview

Head Parallel обеспечивает регулярную связь между устройствами: активации рассылаются по измерению голов с заранее известными формами, поэтому буферы выделяются заранее, а динамическая маршрутизация ограничена внутри владельца каждой головы. Система обучения сопоставляет обмен активациями голов с InfiniBand между узлами, а перешардирование состояния экспертов с NVLink внутри узлов; сопутствующие проекты MagiCompiler и MagiAttention отвечают за ядра и внимание. Что касается данных, в отчете описывается переход от курирования, основанного на фильтрации, к высокопроизводительному производству данных с точной мультимодальной аннотацией.

Доступность

Вывод выполняется через официальный пайплайн на Python (torchrun, с предоставляемым Docker-образом) и требует 8 GPU NVIDIA Hopper. Пользовательских нод ComfyUI для MAGI-2 на данный момент нет. Полный набор чекпоинтов на Hugging Face занимает около 307 ГБ: Transformer этапа предпросмотра на 228 ГБ, рефайнер на 14 ГБ, текстовый энкодер Qwen3.5-27B (56 ГБ), видео-VAE Wan2.2, аудио-VAE Stable Audio Open 1.0 и дистиллированный турбо-декодер VAE, используемый по умолчанию.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
MAGI-2 Preview: открытая модель Sand.ai на 114B для видео и аудио | ComfyUI Wiki