HyperFlow:8 步 MiniMax H3 LoRA 与 ComfyUI 移植版

ComfyUI Wikinews

Video Rebirth 的 HyperFlow 通过无数据自蒸馏 LoRA,将 MiniMax H3 的采样从 49 次 transformer 前向压缩到 8 次;随后出现了两个 ComfyUI 移植版。

Video Rebirth 发布了 HyperFlow,这是一个面向 MiniMax H3 的 8 步 LoRA,可将基础模型的 49 次 transformer 前向压缩为 8 次。它是 H3 加速竞赛中的最新成员,与 lightx2v 和 ModelTC 的蒸馏版本不同,它在发布后数天内就迎来了两个独立的 ComfyUI 移植版。

HyperFlow 相机控制示例

来自 Video Rebirth 展示页面的 HyperFlow 相机控制示例。

HyperFlow 是什么

HyperFlow 通过**无数据流自蒸馏(data-free flow self-distillation)**获得。该模型自行生成候选视频,对其进行质量筛选,然后从通过筛选的候选中蒸馏,全程不使用外部数据,也不需要人工标注。Video Rebirth 将其描述为 RSI(Recursive Self-Improvement,递归自我改进)中的自蒸馏组件,这也是其视频模型背后的训练范式。

重要的结构性选择在于:基础权重、两个 VAE、conditioner 以及 t2vafl2varef2va 工作流全部保持官方 MiniMax H3 的版本。发布的只有 LoRA。

属性
适配器形式PEFT LoRA,rank 256 / alpha 256
模块316 个:注意力、前馈以及两个时间嵌入器
大小单个 2.8 GB safetensors 文件
采样在文件中存储的固定 sigma 网格上进行 8 次前向(视频 shift 12,音频 shift 3)
覆盖范围t2vafl2varef2va,视频与音频同步

上游实现基于官方 diffusers Modular Pipeline 运行,提供的是加载器加示例脚本,而非合并后的模型,因此需要执行 pip install "hyperflow-h3[examples] @ git+https://github.com/Video-Rebirth/hyperflow.git",并要求 diffusers 0.40 或更高版本。HyperFlow 还支持跨最多 4 块 GPU 的 Ulysses 上下文并行,以及 NVIDIA 的 Sol-Attn 稀疏注意力内核。

HyperFlow 视觉一致性示例

整个片段的连贯性,这是 Video Rebirth 发布的四个展示分类之一。

两条 ComfyUI 路线

该 LoRA 并非可直接用于 ComfyUI LoRA 加载器的现成文件。目前有两种运行方式。

1. 使用 ComfyUI 内置加载器的社区转换版。 贡献者 drbaph 将 HyperFlow 转换为 ComfyUI 的键布局,共有四个文件,覆盖完整版和 pruned/曲线形式的 H3 基础模型:

文件变体
minimax_h3_hyperflow_8step_v1.0_comfyui_bf16.safetensors完整 BF16
minimax_h3_hyperflow_8step_v1.0_comfyui_bf16_resized_avg_rank_20_bf16.safetensors重缩放,平均 rank 20
minimax_h3_hyperflow_8step_v1.0_comfyui_pruned_bf16.safetensors用于 pruned/曲线形式基础模型
minimax_h3_hyperflow_8step_v1.0_comfyui_pruned_bf16_resized_avg_rank_20_bf16.safetensorsPruned 加重缩放

这些文件可通过 ComfyUI 内置的 MiniMax H3 LoRA 加载器加载,无需自定义节点。文档中给出的设置是 8 步、LoRA 强度从 1.0 起步,并使用 euler / normal 或上游的手动 sigma 序列:

1.0, 0.931506, 0.839236, 0.703462, 0.5, 0.296538, 0.160764, 0.068494, 0.0

2. 复现端点条件(endpoint conditioning)的节点包。 ComfyUI-HyperFlow 说明了为什么直接转换并不等价。HyperFlow 不只是一个 LoRA:每一步都以它所积分的区间为条件,即 (t, r),其中 r = 1 - sigma_next,通过第二个经过 LoRA 的时间嵌入器实现,形式为 emb_t(t) + gate*(emb_r(r) - emb_t(t))。ComfyUI 的采样器从不传入 r,因此该节点包构建了端点嵌入器并修补 time_embedder.forward,为视频、文本、音频以及固定关键帧行逐行计算端点。它还会将 PEFT 参数名重新映射到 ComfyUI 融合后的 qkv_projmlp.fc1proj_in/proj_out 目标上,并拒绝那些没有时间嵌入器可供修补的曲线形式模型。该节点包除 ComfyUI 本身外没有任何依赖关系。

HyperFlow 材质与细节示例

材质与细节:少数步 H3 蒸馏通常最先丢失的类别。

独立佐证

最强的第三方信号来自 NVIDIA 的研究仓库:NVlabs/Sana PR #507models/minimax_h3/HyperFlow/ 下添加了 HyperFlow 八步推理,支持 T2V、首帧 I2V 以及带同步音频的图像引用 Ref2VA,并于 9 月 19 日合并。该集成固定了 Video Rebirth 的确切提交和 LoRA 修订版本,保留了 HyperFlow 的双时间条件(two-time conditioning)和八步调度,保留了独立的 transformertransformer_ref 权重,并在 Sol-H3 Ulysses、SOL/BSA 和并行 VAE 路径之上新增了配对 AdaLN 预计算与经验证的 conditioner 剪枝。其初始常驻档案面向八块 B200 GPU、1344x768 分辨率,并提供 5 秒、10 秒和 15 秒预设。

早期用户如何评价

HyperFlow 于 9 月 18 日,即发布一天后出现在 Banodoco 的 #minimax_h3_chatter 中,讨论迅速从"新的 8 步 LoRA 发布了"转向与旧版 H3 Turbo LoRA 的实测对比。

  • drbaph,即完成 ComfyUI 转换的人,将其卖点描述为"相比其他 turbo LoRA,更接近 H3 的原生质量,连贯性/相机控制/细节也更好",并补充说他按照上游建议在强度 1.0 下进行测试。在 8 步方案中,他个人仍偏好提取出来的 DMD VDN LoRA,他称其与 HyperFlow"接近"。
  • hacs2000 在测试两者后,评价其"非常好"。
  • Stef 已标记手动 sigma 表容易被忽略,应该记录在用户能找到的地方。

在你比较运行结果之前,请注意 sigma 的注意事项:drbaph 的转换将固定网格以手动 sigmas 的形式暴露出来,而节点包则原生计算端点,因此两条路线并非逐字节一致。

HyperFlow 均衡能力示例

均衡能力,第四个展示分类。

获取方式

关于 HyperFlow 与其他 H3 加速方案的对比定位,请参阅 H3 Acceleration Arena 盲测 A/B 排名;至于上一个独立的 Turbo 转换工作流,请参阅 VDN-H3 Turbo Standalone

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
HyperFlow:8 步 MiniMax H3 LoRA 与 ComfyUI 移植版 | ComfyUI Wiki