MiniMax H3 RAVEN LoRA: Vídeo en streaming en tiempo real en ComfyUI
RAVEN (Imperial College London) convierte MiniMax H3 en un generador de vídeo en streaming con un adaptador LoRA 4-NFE y nodos oficiales de ComfyUI.
RAVEN (Real-time Autoregressive Video Extrapolation with Consistency-model GRPO), un proyecto de investigación del Imperial College London, publica un adaptador LoRA que convierte MiniMax H3 en un generador de streaming causal: en lugar de aplicar denoising a un único clip bidireccional, el modelo genera vídeo fragmento a fragmento, extrapolando cada nuevo fragmento a partir del contenido generado anteriormente. El adaptador de vista previa publicado genera 192 fotogramas a 1376×768 / 24 fps con solo 4 pasos de muestreo (NFE), y el proyecto incluye nodos oficiales de ComfyUI (ComfyUI-MiniMax-H3-RAVEN-Streaming) además de un flujo de trabajo de ejemplo de extremo a extremo.
Cómo funciona
RAVEN conserva la arquitectura de MiniMax-H3 y añade una cabeza de streaming entrenada con consistency-model GRPO: cada fragmento se genera a partir del contexto anterior con un número pequeño y fijo de evaluaciones de función. Esto hace que la generación sea progresiva: el contenido aparece fragmento a fragmento en lugar de todo a la vez, lo que constituye el bloque fundamental para la interacción en tiempo real. El adaptador de vista previa de 4 NFE actúa conjuntamente sobre las rejillas de vídeo y audio, de modo que los flujos de texto a vídeo y audio (T2VA) surgen del mismo paso causal.
El peso publicado es un adaptador LoRA (r=128, lora_alpha=128) cargado sobre MiniMax-H3; es una versión de vista previa inicial y los autores señalan que el detalle de las texturas aún se está mejorando.
RAVEN convierte el denoising bidireccional en una extrapolación de streaming causal, fragmento a fragmento (figura de la página del proyecto)
Demo
Reel de generación en streaming de la página del proyecto RAVEN (vídeo de yanzuo.lu)
Comparación de preferencias humanas del artículo de RAVEN
Detalles del modelo
| Elemento | Valor |
|---|---|
| Modelo base | MiniMaxAI/MiniMax-H3 |
| Adaptador | LoRA, r=128, lora_alpha=128 |
| Muestreo | 4 NFE (rejillas de vídeo y audio) |
| Fotogramas | 192 |
| Resolución | 768 × 1376 |
| Frecuencia de cuadros | 24 fps |
| Fragmentación causal | sink=2, window=2 |
| Archivo de pesos | minimax_h3_raven_streaming_lora_4nfe_preview.safetensors (~5 GB) |
Uso en ComfyUI
Los nodos oficiales se publicaron el 20 de agosto de 2026 y están disponibles en el Comfy Registry con el nombre comfyui-minimax-h3-raven-streaming. Para instalarlos, busca MiniMax H3 RAVEN Streaming en ComfyUI-Manager o ejecuta comfy node install comfyui-minimax-h3-raven-streaming, y reinicia ComfyUI.
- Instala los nodos personalizados (con ComfyUI-Manager o clonando el repositorio en
custom_nodes/). - Descarga
minimax_h3_raven_streaming_lora_4nfe_preview.safetensorsenComfyUI/models/loras/y coloca los archivos estándar del modelo MiniMax H3 en sus carpetas habituales. - Carga el flujo de trabajo de ejemplo incluido (Flujo de trabajo → Explorar plantillas → Extensiones, o arrastra el JSON de abajo al lienzo) y ejecútalo.
El paquete de nodos implementa el muestreador de streaming por fragmentos (chunk-major), un widget de vista previa de streaming y las conexiones obligatorias del LoRA RAVEN sobre la implementación integrada de MiniMax H3 en ComfyUI. Los autores validaron la generación de 192 fotogramas a 1376×768 dentro de un límite simulado de 24 GiB de VRAM.
Esto no es soporte nativo de ComfyUI: los nodos de streaming dependen del paquete de nodos personalizados de terceros
ComfyUI-MiniMax-H3-RAVEN-Streaming.
Disponibilidad
- Pesos: mvp-lab/MiniMax-H3-RAVEN-Streaming-LoRA (Licencia comunitaria de MiniMax H3)
- Página del proyecto: yanzuo.lu/raven
- Artículo: arXiv:2605.15190
- Código: mvp-ai-lab/RAVEN
- Nodos de ComfyUI: YanzuoLu/ComfyUI-MiniMax-H3-RAVEN-Streaming · Comfy Registry
Comentarios
Inicia sesión con GitHub para unirte a la conversación.