VDN-H3 Turbo 独立发布:ComfyUI 中 MiniMax H3 的 8 步 LoRA

ComfyUI Wikinews

drbaph 将 VDN-H3 Turbo 适配器提取为 MiniMax H3 的独立 8 步 LoRA,包含剪枝后的 fl2va/ref2va 变体,以及用于 Comfy Kitchen 的 INT8 ConvRot checkpoint。

VDN-H3 是 MiniMax H3 的混合注意力 Video DeltaNet 重构版本,它将二次长程注意力替换为线性 Video Delta 注意力分支(阅读原始报道)。9 月 9 日,社区贡献者 drbaph 在 Hugging Face 上发布了两个后续更新:将 VDN-H3 Turbo 适配器提取为可在未修改的 MiniMax H3 checkpoint 上使用的独立 8 步 LoRA,以及 VDN-H3 checkpoint 的预量化 INT8 ConvRot版本,其 VRAM 占用减少了约 1.8 GB,线性分支速度提升了约 2.7 倍。

为什么独立版很重要

直到现在,运行 VDN-H3 Turbo 适配器的唯一方法是通过 ComfyUI-VDN-H3 自定义节点配合完整的混合注意力补丁:同时加载 8 步 checkpoint、其线性分支和两个适配器。新的独立 LoRA 将该 Turbo 适配器从堆栈中剥离,并重新打包为普通的 MiniMax H3 LoRA,因此它可以在使用 ComfyUI 内置 LoRA 加载器加载标准 H3 checkpoint 时直接使用,无需自定义节点。

据 drbaph 所述,VDN-H3 内部的 Turbo 适配器最初源自 larryvrh 的 MiniMax H3 Turbo LoRA,随后作为 VDN-H3 的一部分进行了进一步的 DMD 训练。此次发布是该结果适配器的独立转换版本,因此它携带了来自两个源系的蒸馏信号。

发布内容

LoRA 位于 drbaph/MiniMax-H3-Turbo-Lora-ComfyUIexperimental/ 文件夹中:

文件基础备注
minimax_h3_dmd_8step_turbo.safetensors未剪枝 fl2va / ref2va一个 LoRA 适用于两种未剪枝变体
minimax_h3_dmd_fl2va_8step_turbo_pruned.safetensors剪枝 fl2va针对剪枝/曲线形 checkpoint 的单独变体
minimax_h3_dmd_ref2va_8step_turbo_pruned.safetensors剪枝 ref2va针对剪枝/曲线形 checkpoint 的单独变体

推荐设置:8 步,强度 0.65 到 1.0。每个剪枝文件约为 2.1 GB。

INT8 ConvRot VDN checkpoint

第二个发布针对完整的 VDN-H3 路线。drbaph/vdn-minimax-h3-int8-convrot-comfyui 将 8 步 stage-dmd-step-250 checkpoint 预量化为 Comfy Kitchen INT8 ConvRot 格式,这与 ComfyUI 为其自身的 int8-convrot diffusion 模型提供的序列化格式相同。仅量化线性分支的分发矩阵乘法权重;适配器、偏置、归一化和卷积保持不变。

bf16 原始INT8 ConvRot
线性分支4.28 GB2.20 GB
阶段总计5.09 GB3.25 GB
分支矩阵乘法1x约 2.7 倍更快
端到端(单次测试运行)约 111 s约 95 s

使用相同种子的 1280x736 / 61 帧 A/B 渲染在视觉上完全相同,且加载时的峰值 VRAM 下降了约 4.7 GB。量化阶段需要 ComfyUI-VDN-H3 v1.3.0 或更高版本,并像原版一样放入 ComfyUI/models/vdn/

使用 INT8 ConvRot 阶段渲染的 Ref2VA 示例:8 步,er_sde / beta,928x928。

与其他 H3 加速器的配合

本周 Banodoco H3 频道的社区测试将这些数据置于背景中:VDN 路线以牺牲部分速度为代价换取比 lightx2v turbo LoRA 更好的性能(同一硬件上的基准测试显示,8 步 VDN Turbo 处理 1280x736 耗时 2:04,而 4 步 lightx2v turbo 耗时 1:24),但在保持快速运动方面优于 FastH3 路线。独立的 8 步 LoRA 现在提供了一个中间选项:VDN 的 DMD 蒸馏适配器,无需加载线性分支。

对于 50 步音频工作,drbaph 建议的方案是最小生成 512x512,然后通过 ref2va turbo 8 步路径放大到 1080p,为了速度先缩小到 256。

可用性

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
VDN-H3 Turbo 独立发布:ComfyUI 中 MiniMax H3 的 8 步 LoRA | ComfyUI Wiki