MAGI-2 Preview: Sand.ai 开源 114B 音视频模型
Sand.ai 开源 MAGI-2 Preview,这是一个 114B 参数的 MoE 模型,可将文本或图像转换为带有同步音频的 10 秒视频,每个 token 仅激活 6B 参数。
8月5日,Sand.ai 发布了 MAGI-2 Preview,这是一个开源的 114B 参数混合专家(MoE)模型,可根据文本提示词或提示词加静态图像生成带有同步音频的 10 秒视频。权重、推理代码 以及题为 "Scaling Video Generation Models Efficiently" 的技术报告 均已公开。
来自 Sand.ai 公告的 MAGI-2 Preview 官方视觉图
MAGI-2 是 Sand.ai 于 2025 年 4 月推出的自回归视频模型 MAGI-1 的后续版本。MAGI-1 研究的是视频应该如何生成;MAGI-2 则提出了视频生成模型应该如何扩展的问题,而预览版验证了其架构、训练系统和数据流水线可以在 100B 级别上协同扩展。
一个模型统一处理视频、音频和文本
MAGI-2 采用单流设计:文本、视频和音频 token 被拼接成一个统一的序列,由同一个 Transformer 主干处理。语言、嘴唇动作、身体运动、声音和相机节奏在整个模型中交换信息,而不是让模态仅在狭窄的交叉注意力接口处交互。该模型在一次生成过程中同时生成视觉和声音,然后将音轨混入输出的视频文件中。
| 功能 | 详情 |
|---|---|
| 输入 | 文本提示词(T2V),或文本 + 静态图像(I2V) |
| 输出 | 带有同步音频的 10 秒视频(唯一支持的时长) |
| 生成 | 两阶段:预览阶段为 512×896,细化阶段将图像放大至 1088×1920 |
| 提示词 | 长结构化描述;仓库附带用于基于 LLM 的提示词增强的系统提示词 |
来自 Sand.ai 官方站点的演示视频
官方演示批处理与 T2V 和 I2V 条目使用相同的提示词,并使用类似这样的静态图像作为图像输入:
![]() | ![]() |
|---|---|
| 来自官方演示批处理的示例静态图像 | 来自官方演示批处理的示例静态图像 |
MagiMoE:114B 参数,每个 Token 激活约 6B
该架构将多头 Latent 路由方案与超细粒度专家相结合,将总容量与每个 token 的计算量解耦。每个 token 的表示被拆分为 12 个 256 维的 Latent 头;每个头都有自己的路由器,并从 256 个窄专家池中选择 top-6 专家。因此,每个稀疏层包含 3,072 个头局部专家单元,其中每个 token 仅激活 72 个。
| 组件 | 配置 |
|---|---|
| 主干 | 40 层 Transformer(36 个稀疏层,4 个稠密边界层) |
| 模型宽度 | 3,072 |
| 路由表示 | 12 个头 × 256 维 |
| 专家池 | 每个头 256 个专家,top-6 激活 |
| 专家 FFN | 256 → 1,280 → 256,融合 SwiGLU |
来自 MAGI-2 Preview 技术报告的架构与系统概述
**Head Parallel(头并行)**使跨设备通信保持规整:激活沿头维度以静态已知的形状进行派发,因此缓冲区会被预分配,动态路由被限制在每个头所有者内部。训练系统将头激活交换映射到跨节点的 InfiniBand 上,将专家状态重新分片映射到节点内的 NVLink 上,配套的 MagiCompiler 和 MagiAttention 项目负责处理内核和注意力。在数据方面,报告描述了从以过滤为中心的整理向带有精确多模态标注的高吞吐量数据生产的转变。
可用性
推理通过官方 Python 流水线(使用 torchrun,并提供了 Docker 镜像)进行,需要 8 块 NVIDIA Hopper GPU。目前还没有适用于 MAGI-2 的 ComfyUI 自定义节点。Hugging Face 上的完整 checkpoint 集合约为 307 GB:包括 228 GB 的预览阶段 Transformer、14 GB 的细化器、Qwen3.5-27B 文本编码器(56 GB)、Wan2.2 视频 VAE、Stable Audio Open 1.0 音频 VAE,以及默认使用的蒸馏 turbo VAE 解码器。


评论
使用 GitHub 登录后即可参与讨论。