MAGI-2 미리보기: Sand.ai의 오픈소스 114B 오디오-비디오 모델
Sand.ai가 MAGI-2 미리보기를 오픈소스로 공개했습니다. 텍스트나 이미지를 동기화된 오디오가 포함된 10초 비디오로 변환하는 114B 파라미터 MoE 모델로, 토큰당 6B 파라미터만 활성화합니다.
Sand.ai가 8월 5일 MAGI-2 미리보기를 공개했습니다. 이 모델은 텍스트 프롬프트 또는 프롬프트와 정지 이미지를 입력으로 동기화된 오디오가 포함된 10초 비디오를 생성하는 오픈소스 114B 파라미터 MoE(혼합 전문가) 모델입니다. 가중치, 추론 코드, 그리고 "비디오 생성 모델의 효율적 확장(Scaling Video Generation Models Efficiently)"이라는 제목의 기술 보고서도 모두 공개되었습니다.
Sand.ai 발표에 포함된 MAGI-2 미리보기 공식 비주얼
MAGI-2는 Sand.ai가 2025년 4월에 공개한 오토리그레시브 비디오 모델인 MAGI-1의 후속 모델입니다. MAGI-1이 비디오가 어떻게 생성되어야 하는지를 연구했다면, MAGI-2는 비디오 생성 모델이 어떻게 확장되어야 하는지를 묻습니다. 이번 미리보기 릴리스는 아키텍처, 학습 시스템, 데이터 파이프라인이 100B 규모에서 함께 확장될 수 있음을 검증합니다.
비디오, 오디오, 텍스트를 위한 하나의 모델
MAGI-2는 단일 스트림 설계를 유지합니다. 텍스트, 비디오, 오디오 토큰이 하나의 통합 시퀀스로 결합되어 동일한 Transformer 백본에서 처리됩니다. 모달리티가 좁은 크로스 어텐션 인터페이스에서만 상호작용하도록 두는 대신, 언어, 입술 움직임, 신체 동작, 사운드, 카메라 리듬이 모델 전체에서 정보를 교환합니다. 모델은 비주얼과 사운드를 한 번의 패스로 생성한 다음, 오디오 트랙을 출력 비디오 파일에 결합(muxing)합니다.
| 기능 | 세부 사항 |
|---|---|
| 입력 | 텍스트 프롬프트(T2V) 또는 텍스트 + 정지 이미지(I2V) |
| 출력 | 동기화된 오디오가 포함된 10초 비디오(유일하게 지원되는 재생 시간) |
| 생성 | 2단계: 미리보기 단계 512×896, 리파이너 단계에서 1088×1920으로 업스케일링 |
| 프롬프트 | 길고 구조화된 캡션 사용. 저장소에 LLM 기반 프롬프트 향상을 위한 시스템 프롬프트 포함 |
Sand.ai 공식 사이트에서 가져온 데모 비디오
공식 데모 배치는 T2V 및 I2V 항목과 동일한 프롬프트를 실행하며, 다음과 같은 스틸 이미지를 이미지 입력으로 사용합니다:
![]() | ![]() |
|---|---|
| 공식 데모 배치의 샘플 스틸 이미지 | 공식 데모 배치의 샘플 스틸 이미지 |
MagiMoE: 114B 파라미터, 토큰당 약 6B 활성화
이 아키텍처는 멀티헤드 latent 라우팅 방식과 **초세분화 전문가(ultra-fine-grained experts)**를 결합하여 총 용량과 토큰당 연산량을 분리합니다. 각 토큰의 표현은 256차원의 12개 latent 헤드로 분할되며, 각 헤드는 자체 라우터를 보유하고 256개의 좁은 전문가 풀에서 상위 6개 전문가를 선택합니다. 따라서 각 sparse 레이어에는 3,072개의 헤드 로컬 전문가 유닛이 포함되며, 토큰당 72개만 활성화됩니다.
| 구성 요소 | 설정 |
|---|---|
| 백본 | Transformer 레이어 40개(sparse 36개, dense 경계 레이어 4개) |
| 모델 너비 | 3,072 |
| 라우팅된 표현 | 12개 헤드 × 256차원 |
| 전문가 풀 | 헤드당 256개 전문가, 상위 6개 활성화 |
| 전문가 FFN | 256 → 1,280 → 256, fused SwiGLU |
MAGI-2 미리보기 기술 보고서의 아키텍처 및 시스템 개요
**헤드 병렬 처리(Head Parallel)**는 크로스 디바이스 통신을 규칙적으로 유지합니다. 활성화가 정적으로 알려진 형태의 헤드 차원을 따라 전달되므로 버퍼가 사전 할당되고, 동적 라우팅은 각 헤드 소유자 내부로 제한됩니다. 학습 시스템은 노드 간 헤드 활성화 교환을 InfiniBand에, 노드 내 전문가 상태 리샤딩을 NVLink에 매핑하며, 함께 제공되는 MagiCompiler 및 MagiAttention 프로젝트가 커널과 어텐션을 처리합니다. 데이터 측면에서 이 보고서는 필터링 중심의 큐레이션에서 정밀한 멀티모달 주석이 포함된 고처리량 데이터 생성으로의 전환을 설명합니다.
공개 및 이용 안내
추론은 공식 Python pipeline(torchrun, 제공되는 Docker 이미지 사용)을 통해 실행되며 NVIDIA Hopper GPU 8개가 필요합니다. 현재 MAGI-2용 ComfyUI 커스텀 노드는 없습니다. Hugging Face에 공개된 전체 checkpoint 세트는 약 307GB입니다. 228GB 미리보기 단계 Transformer, 14GB 리파이너, Qwen3.5-27B 텍스트 인코더(56GB), Wan2.2 비디오 VAE, Stable Audio Open 1.0 오디오 VAE, 그리고 기본적으로 사용되는 증류(distilled) turbo VAE 디코더로 구성됩니다.


댓글
GitHub로 로그인하고 토론에 참여하세요.