SANA-Video 2.0 4 步预览:NVIDIA 快速 720p 视频模型

ComfyUI Wikinews

NVIDIA 发布了基于 DMD 蒸馏的 SANA-Video 2.0 5B 4 步预览版,在 BF16 CFG-1 推理下生成 720p 81 帧视频,采用四阶段采样策略。

NVIDIA 的 SANA 团队发布了 SANA-Video 2.0 5B 720p 的蒸馏 4 步研究预览版Efficient-Large-Model/SANA-Video_2.0_5B_720p_4step。该 checkpoint 仅需四个采样阶段即可生成 736×1280、81 帧(16 FPS)的文生视频。来源:Hugging Face 仓库 README。

概述

该预览版是完整模型的 DMD 蒸馏,而非 LoRA 适配器:全局步骤 1000 的 DMD EMA 导出是在合并了 ReFL step-500 适配器之后,从 SANA-Video 2.0 SFT 模型初始化的,随后 DMD 更新整个 transformer。架构结合了 75% 的门控双向线性注意力层与 25% 的周期性密集 softmax 注意力锚点,每 8 个图层共享 Attention Residual 聚合。文本编码器为 google/gemma-2-2b-it,VAE 为 LTX 2.3,具有 128 个 latent 通道。

SANA-Video 2.0 4 步预览样本

验证的种子 4 样本:花卉复古房间中的卡通公鸡,使用确切发布的 checkpoint 和设置生成。来源:SANA-Video 2.0 5B 720p 4 步

四阶段采样契约

模型不使用截断的 DPM-Solver 轨迹。在每个固定阶段,模型预测速度,计算 x0,并在下一个 sigma 处重新添加噪声,从同一种子生成器中重新抽取:

StagePhysical sigmaModel embedding timestep
10.9998999
20.9472947
30.8569856
40.6664666

推理运行 BF16 精度,CFG 为 1,使用 sana_shift6_dpm sigma 档案并禁用 flow_shift。发布的 checkpoint 在这些确切设置下在完整的 VBench T2V 套件(4,730 个提示词,所有 16 个尺寸)上进行了评估。

可用性

该 checkpoint 附带 .pth EMA transformer 以及干净的 5B 源塔配置。在上游 PR 合并之前,推理需要 Sana 仓库 的预览分支 (feat/sana-video2-4step-preview),搭配 Diffusers 格式的 LTX 2.3 VAE。50 步基础版本仍是图像条件化 TI2V 的入口点:蒸馏预览版仅用于文生视频,不支持首帧图像 conditioning。

验证的四步样本视频 (1280×736, 81 帧,16 FPS),使用种子 4 生成。来源:SANA-Video 2.0 5B 720p 4 步

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
SANA-Video 2.0 4 步预览:NVIDIA 快速 720p 视频模型 | ComfyUI Wiki