MiniMax H3 RAVEN LoRA:在 ComfyUI 中实现实时流式视频生成

ComfyUI Wikinews

RAVEN(伦敦帝国理工学院)通过 4-NFE LoRA 适配器将 MiniMax H3 转变为实时流式视频生成器,并提供官方 ComfyUI 节点实现逐块输出。

RAVEN(基于一致性模型 GRPO 的实时自回归视频外推,Real-time Autoregressive Video Extrapolation with Consistency-model GRPO)是伦敦帝国理工学院(Imperial College London)的一个研究项目,发布了可将 MiniMax H3 转变为因果流式生成器的 LoRA 适配器:该模型不再对单个双向片段进行去噪,而是逐块生成视频,并从先前已生成的内容外推出每个新块。发布的预览适配器仅需 4 步采样(NFE) 即可生成 192 帧、1376×768 分辨率、24 fps 的视频,项目还提供了官方 ComfyUI 节点ComfyUI-MiniMax-H3-RAVEN-Streaming)以及端到端的示例工作流。

工作原理

RAVEN 保留了 MiniMax-H3 的架构,并添加了一个使用一致性模型 GRPO 训练的流式输出头:每个块都基于上一个上下文,以少量固定的函数评估次数生成。这使得生成具有渐进性,内容逐块出现,而非一次性全部生成,这是实现实时交互的关键构建模块。4-NFE 预览适配器同时作用于视频和音频网格,因此文生视频和音频(T2VA)流可以在同一次因果传递中输出。

发布的权重是加载在 MiniMax-H3 之上的 LoRA 适配器r=128lora_alpha=128)。这是初始预览版本,作者指出纹理细节仍在改进中。

RAVEN architecture

RAVEN 将双向去噪转变为因果的、逐块的流式外推(图片来自项目主页)

演示

来自 RAVEN 项目主页的流式生成演示视频(视频来源:yanzuo.lu)

Preference comparison

来自 RAVEN 论文的人类偏好对比

模型详情

项目
基础模型MiniMaxAI/MiniMax-H3
适配器LoRA,r=128,lora_alpha=128
采样4 NFE(视频和音频网格)
帧数192
分辨率768 × 1376
帧率24 fps
因果分块sink=2,window=2
权重文件minimax_h3_raven_streaming_lora_4nfe_preview.safetensors(约 5 GB)

ComfyUI 使用方法

官方节点于 2026 年 8 月 20 日发布,并已上架 Comfy Registry,名称为 comfyui-minimax-h3-raven-streaming。在 ComfyUI-Manager 中搜索 MiniMax H3 RAVEN Streaming 即可安装,或运行 comfy node install comfyui-minimax-h3-raven-streaming,然后重新启动 ComfyUI。

  1. 安装自定义节点(通过 ComfyUI-Manager 安装,或使用 git clone 到 custom_nodes/ 目录)。
  2. minimax_h3_raven_streaming_lora_4nfe_preview.safetensors 下载到 ComfyUI/models/loras/ 目录,并将标准的 MiniMax H3 模型文件放入各自的常用文件夹。
  3. 加载随附的示例工作流(Workflow → 浏览模板 → 扩展,或将下方 JSON 拖拽到画布上)并运行。

该节点包在 ComfyUI 内置的 MiniMax H3 实现之上,提供了块优先(chunk-major)的流式采样器、流式预览组件以及必需的 RAVEN LoRA 连线。作者在模拟的 24 GiB 显存 环境下验证了 1376×768 / 192 帧的生成。

这不是 ComfyUI 的原生支持:流式节点依赖于第三方 ComfyUI-MiniMax-H3-RAVEN-Streaming 自定义节点包。

获取方式

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…
MiniMax H3 RAVEN LoRA:在 ComfyUI 中实现实时流式视频生成 | ComfyUI Wiki