MiniMax H3 RAVEN LoRA : streaming vidéo en temps réel dans ComfyUI
RAVEN (Imperial College London) transforme MiniMax H3 en générateur vidéo en streaming via un adaptateur LoRA 4-NFE et des nœuds ComfyUI officiels.
RAVEN (Real-time Autoregressive Video Extrapolation with Consistency-model GRPO), un projet de recherche de l'Imperial College London, publie un adaptateur LoRA qui transforme MiniMax H3 en générateur de streaming causal : au lieu de débruiter un clip bidirectionnel, le modèle génère la vidéo chunk par chunk, en extrapolant chaque nouveau chunk à partir du contenu généré précédemment. L'adaptateur d'aperçu publié génère 192 images en 1376×768 / 24 fps avec seulement 4 étapes d'échantillonnage (NFE), et le projet fournit des nœuds ComfyUI officiels (ComfyUI-MiniMax-H3-RAVEN-Streaming) ainsi qu'un flux de travail d'exemple de bout en bout.
Comment ça fonctionne
RAVEN conserve l'architecture de MiniMax-H3 et ajoute une tête de streaming entraînée avec consistency-model GRPO : chaque chunk est généré à partir du contexte précédent avec un petit nombre fixe d'évaluations de fonction. Cela rend la génération progressive (le contenu apparaît chunk par chunk plutôt que d'un seul coup), ce qui constitue le bloc de construction clé pour l'interaction en temps réel. L'adaptateur d'aperçu 4-NFE cible conjointement les grilles vidéo et audio, de sorte que les flux texte-vers-vidéo-et-audio (T2VA) proviennent du même passage causal.
Le poids publié est un adaptateur LoRA (r=128, lora_alpha=128) chargé par-dessus MiniMax-H3 ; il s'agit d'une version d'aperçu initiale, et les auteurs notent que le détail des textures est encore en cours d'amélioration.
RAVEN transforme le débruitage bidirectionnel en extrapolation de streaming causale, chunk par chunk (figure issue de la page du projet)
Démo
Démo de génération en streaming tirée de la page du projet RAVEN (vidéo de yanzuo.lu)
Comparaison des préférences humaines tirée de l'article RAVEN
Détails du modèle
| Élément | Valeur |
|---|---|
| Modèle de base | MiniMaxAI/MiniMax-H3 |
| Adaptateur | LoRA, r=128, lora_alpha=128 |
| Échantillonnage | 4 NFE (grilles vidéo et audio) |
| Images | 192 |
| Résolution | 768 × 1376 |
| Fréquence d'images | 24 fps |
| Découpage causal en chunks | sink=2, window=2 |
| Fichier de poids | minimax_h3_raven_streaming_lora_4nfe_preview.safetensors (~5 Go) |
Utilisation dans ComfyUI
Les nœuds officiels ont été publiés le 20 août 2026 et sont disponibles sur le Comfy Registry sous le nom comfyui-minimax-h3-raven-streaming. Installez-les en recherchant MiniMax H3 RAVEN Streaming dans ComfyUI-Manager, ou avec comfy node install comfyui-minimax-h3-raven-streaming, puis redémarrez ComfyUI.
- Installez les nœuds personnalisés (via ComfyUI-Manager ou
git clonedanscustom_nodes/). - Téléchargez
minimax_h3_raven_streaming_lora_4nfe_preview.safetensorsdansComfyUI/models/loras/et placez les fichiers standard du modèle MiniMax H3 dans leurs dossiers habituels. - Chargez le flux de travail d'exemple inclus (Workflow → Parcourir les modèles → Gérer les extensions, ou glissez le JSON ci-dessous sur la toile) et lancez-le.
Le pack de nœuds implémente l'échantillonneur de streaming chunk-major, un widget d'aperçu de streaming et le câblage obligatoire de la LoRA RAVEN par-dessus l'implémentation MiniMax H3 intégrée à ComfyUI. Les auteurs ont validé la génération de 192 images en 1376×768 dans une enveloppe simulée de 24 Gio de VRAM.
Il ne s'agit pas d'une prise en charge native de ComfyUI : les nœuds de streaming dépendent du pack de nœuds personnalisés tiers
ComfyUI-MiniMax-H3-RAVEN-Streaming.
Disponibilité
- Poids : mvp-lab/MiniMax-H3-RAVEN-Streaming-LoRA (licence Communauté MiniMax H3)
- Page du projet : yanzuo.lu/raven
- Article : arXiv:2605.15190
- Code : mvp-ai-lab/RAVEN
- Nœuds ComfyUI : YanzuoLu/ComfyUI-MiniMax-H3-RAVEN-Streaming · Comfy Registry
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.