HyperFlow : LoRA MiniMax H3 en 8 étapes avec les ports ComfyUI
HyperFlow de Video Rebirth réduit l'échantillonnage de MiniMax H3 de 49 passes avant du transformer à 8 grâce à un LoRA d'auto-distillation sans données, avec deux ports ComfyUI.
Video Rebirth a publié HyperFlow, un LoRA en 8 étapes pour MiniMax H3 qui réduit les 49 passes avant du transformer du modèle de base à 8. C'est la dernière entrée dans la course à l'accélération de H3, et contrairement aux distillations lightx2v et ModelTC, elle arrive avec deux ports ComfyUI indépendants quelques jours après son lancement.
Exemple de contrôle de caméra avec HyperFlow, issu de la page de démonstration de Video Rebirth.
Ce qu'est HyperFlow
HyperFlow est obtenu par auto-distillation de flux sans données. Le modèle génère ses propres vidéos candidates, les filtre selon leur qualité puis distille à partir des candidates retenues, sans données externes ni annotations humaines. Video Rebirth présente cela comme la composante d'auto-distillation de RSI (Recursive Self-Improvement), le paradigme d'entraînement derrière ses modèles vidéo.
Le choix structurel important : les poids de base, les deux VAE, le conditioner et les flux de travail t2va, fl2va et ref2va restent tous ceux officiels de MiniMax H3. Seul le LoRA est publié.
| Propriété | Valeur |
|---|---|
| Forme de l'adaptateur | PEFT LoRA, rang 256 / alpha 256 |
| Modules | 316 : attention, feed-forward et les deux time embedders |
| Taille | un seul fichier safetensors de 2,8 GB |
| Échantillonnage | 8 passes avant sur une grille de sigma fixe stockée dans le fichier (video shift 12, audio shift 3) |
| Couverture | t2va, fl2va et ref2va, vidéo et audio ensemble |
L'implémentation amont fonctionne sur le diffusers Modular Pipeline officiel et fournit un loader ainsi que des scripts d'exemple plutôt qu'un modèle fusionné, ce qui impose pip install "hyperflow-h3[examples] @ git+https://github.com/Video-Rebirth/hyperflow.git" avec diffusers 0.40 ou plus récent. HyperFlow prend également en charge le context parallel Ulysses sur jusqu'à 4 GPU et le noyau d'attention creuse Sol-Attn de NVIDIA.
Cohérence sur toute la séquence, l'une des quatre catégories de démonstration publiées par Video Rebirth.
Deux voies ComfyUI
Le LoRA n'est pas un fichier directement utilisable avec le loader LoRA de ComfyUI. Il existe désormais deux façons de l'exécuter.
1. Des conversions communautaires avec le loader intégré de ComfyUI. Le contributeur drbaph a converti HyperFlow vers la disposition de clés de ComfyUI, avec quatre fichiers couvrant les bases H3 complète et pruned/curve-form :
| Fichier | Variante |
|---|---|
minimax_h3_hyperflow_8step_v1.0_comfyui_bf16.safetensors | BF16 complet |
minimax_h3_hyperflow_8step_v1.0_comfyui_bf16_resized_avg_rank_20_bf16.safetensors | Redimensionné, rang moyen 20 |
minimax_h3_hyperflow_8step_v1.0_comfyui_pruned_bf16.safetensors | Pour la base pruned/curve-form |
minimax_h3_hyperflow_8step_v1.0_comfyui_pruned_bf16_resized_avg_rank_20_bf16.safetensors | Pruned plus redimensionné |
Ces fichiers se chargent avec le loader LoRA MiniMax H3 intégré de ComfyUI, sans nœud personnalisé. Les paramètres documentés sont 8 étapes, une force de LoRA démarrant à 1.0, et soit euler / normal, soit la séquence manuelle de sigma en amont :
1.0, 0.931506, 0.839236, 0.703462, 0.5, 0.296538, 0.160764, 0.068494, 0.02. Un pack de nœuds qui reproduit le conditionnement de l'extrémité d'intervalle. ComfyUI-HyperFlow documente pourquoi une simple conversion n'est pas équivalente. HyperFlow n'est pas seulement un LoRA : chaque étape est conditionnée sur l'intervalle qu'elle intègre, (t, r) avec r = 1 - sigma_next, via un second time embedder doté du LoRA, sous la forme emb_t(t) + gate*(emb_r(r) - emb_t(t)). L'échantillonneur de ComfyUI ne transmet jamais r, donc le pack construit l'endpoint embedder et corrige time_embedder.forward, en calculant un endpoint par ligne pour la vidéo, le texte, l'audio et les lignes de keyframe épinglées. Il remappe aussi les noms de paramètres PEFT vers les cibles fusionnées qkv_proj, mlp.fc1 et proj_in/proj_out de ComfyUI, et refuse les checkpoints curve-form qui n'ont aucun time embedder à corriger. Le pack n'a aucune dépendance au-delà de ComfyUI lui-même.
Matériaux et détails : la catégorie que les distillations H3 à peu d'étapes perdent généralement en premier.
Corroboration indépendante
Le signal tiers le plus fort se trouve dans le référentiel de recherche de NVIDIA : NVlabs/Sana PR #507 a ajouté l'inférence HyperFlow en huit étapes sous models/minimax_h3/HyperFlow/ pour le T2V, l'I2V à première image et le Ref2VA par référence d'image avec audio synchronisé, et a été fusionnée le 19 septembre. L'intégration épingle le commit exact et la révision de LoRA de Video Rebirth, préserve le conditionnement à deux temps et le calendrier en huit étapes d'HyperFlow, conserve les poids séparés transformer et transformer_ref, et ajoute un précalcul AdaLN apparié avec un élagage vérifié du conditioner par-dessus les chemins Sol-H3 Ulysses, SOL/BSA et VAE parallèles. Son profil résident initial cible huit GPU B200 en 1344x768 avec des préréglages de 5, 10 et 15 secondes.
Ce qu'en pensent les premiers utilisateurs
HyperFlow est apparu dans le #minimax_h3_chatter de Banodoco le 18 septembre, un jour après sa publication, et le fil est rapidement passé de « new 8 step lora released » à des comparaisons pratiques avec les anciens LoRA H3 Turbo.
- drbaph, qui a réalisé la conversion ComfyUI, a décrit l'atout principal comme étant « closer to h3 quality, consistency/camera control/detail compared to other turbo loras », en ajoutant qu'il teste la force à 1.0 comme le suggère l'amont. Sa propre préférence parmi les options en 8 étapes reste le LoRA DMD VDN extrait, qu'il juge « proche » d'HyperFlow.
- hacs2000, qui a testé les deux, l'a qualifié de « très bon ».
- Stef a signalé que la table manuelle de sigma est facile à manquer et devrait être documentée là où les gens la trouveront.
Notez la mise en garde sur les sigmas avant de comparer vos exécutions : la conversion de drbaph expose la grille fixe sous forme de sigmas manuels, tandis que le pack de nœuds calcule les endpoints nativement, donc les deux voies ne sont pas identiques octet pour octet.
Capacités équilibrées, la quatrième catégorie de démonstration.
Disponibilité
- Poids : videorebirth/hyperflow (LoRA plus manifeste
hyperflow.json) - Code : Video-Rebirth/hyperflow (loader diffusers et scripts d'exemple)
- Démonstration : videorebirth.com/lp/hyperflow
- Conversions ComfyUI : drbaph/MiniMax-H3-Turbo-Lora-ComfyUI
- Pack de nœuds ComfyUI : Addis-Pulse-Studio/ComfyUI-HyperFlow
- Intégration NVIDIA : NVlabs/Sana PR #507
Pour situer HyperFlow face aux autres accélérations H3, consultez le classement A/B à l'aveugle de l'H3 Acceleration Arena, et pour le flux de travail précédent de conversion Turbo autonome, voir VDN-H3 Turbo Standalone.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.