MiniMax H3 RAVEN LoRA : streaming vidéo en temps réel dans ComfyUI

ComfyUI Wikinews

RAVEN (Imperial College London) transforme MiniMax H3 en générateur vidéo en streaming via un adaptateur LoRA 4-NFE et des nœuds ComfyUI officiels.

RAVEN (Real-time Autoregressive Video Extrapolation with Consistency-model GRPO), un projet de recherche de l'Imperial College London, publie un adaptateur LoRA qui transforme MiniMax H3 en générateur de streaming causal : au lieu de débruiter un clip bidirectionnel, le modèle génère la vidéo chunk par chunk, en extrapolant chaque nouveau chunk à partir du contenu généré précédemment. L'adaptateur d'aperçu publié génère 192 images en 1376×768 / 24 fps avec seulement 4 étapes d'échantillonnage (NFE), et le projet fournit des nœuds ComfyUI officiels (ComfyUI-MiniMax-H3-RAVEN-Streaming) ainsi qu'un flux de travail d'exemple de bout en bout.

Comment ça fonctionne

RAVEN conserve l'architecture de MiniMax-H3 et ajoute une tête de streaming entraînée avec consistency-model GRPO : chaque chunk est généré à partir du contexte précédent avec un petit nombre fixe d'évaluations de fonction. Cela rend la génération progressive (le contenu apparaît chunk par chunk plutôt que d'un seul coup), ce qui constitue le bloc de construction clé pour l'interaction en temps réel. L'adaptateur d'aperçu 4-NFE cible conjointement les grilles vidéo et audio, de sorte que les flux texte-vers-vidéo-et-audio (T2VA) proviennent du même passage causal.

Le poids publié est un adaptateur LoRA (r=128, lora_alpha=128) chargé par-dessus MiniMax-H3 ; il s'agit d'une version d'aperçu initiale, et les auteurs notent que le détail des textures est encore en cours d'amélioration.

RAVEN architecture

RAVEN transforme le débruitage bidirectionnel en extrapolation de streaming causale, chunk par chunk (figure issue de la page du projet)

Démo

Démo de génération en streaming tirée de la page du projet RAVEN (vidéo de yanzuo.lu)

Preference comparison

Comparaison des préférences humaines tirée de l'article RAVEN

Détails du modèle

ÉlémentValeur
Modèle de baseMiniMaxAI/MiniMax-H3
AdaptateurLoRA, r=128, lora_alpha=128
Échantillonnage4 NFE (grilles vidéo et audio)
Images192
Résolution768 × 1376
Fréquence d'images24 fps
Découpage causal en chunkssink=2, window=2
Fichier de poidsminimax_h3_raven_streaming_lora_4nfe_preview.safetensors (~5 Go)

Utilisation dans ComfyUI

Les nœuds officiels ont été publiés le 20 août 2026 et sont disponibles sur le Comfy Registry sous le nom comfyui-minimax-h3-raven-streaming. Installez-les en recherchant MiniMax H3 RAVEN Streaming dans ComfyUI-Manager, ou avec comfy node install comfyui-minimax-h3-raven-streaming, puis redémarrez ComfyUI.

  1. Installez les nœuds personnalisés (via ComfyUI-Manager ou git clone dans custom_nodes/).
  2. Téléchargez minimax_h3_raven_streaming_lora_4nfe_preview.safetensors dans ComfyUI/models/loras/ et placez les fichiers standard du modèle MiniMax H3 dans leurs dossiers habituels.
  3. Chargez le flux de travail d'exemple inclus (Workflow → Parcourir les modèles → Gérer les extensions, ou glissez le JSON ci-dessous sur la toile) et lancez-le.

Le pack de nœuds implémente l'échantillonneur de streaming chunk-major, un widget d'aperçu de streaming et le câblage obligatoire de la LoRA RAVEN par-dessus l'implémentation MiniMax H3 intégrée à ComfyUI. Les auteurs ont validé la génération de 192 images en 1376×768 dans une enveloppe simulée de 24 Gio de VRAM.

Il ne s'agit pas d'une prise en charge native de ComfyUI : les nœuds de streaming dépendent du pack de nœuds personnalisés tiers ComfyUI-MiniMax-H3-RAVEN-Streaming.

Disponibilité

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
MiniMax H3 RAVEN LoRA : streaming vidéo en temps réel dans ComfyUI | ComfyUI Wiki