VDN-H3 : vidéo MiniMax H3 accélérée par attention hybride
Le checkpoint Video DeltaNet d'OpenVDN pour MiniMax H3 génère un clip 768p de 14,4 s en 8 étapes, avec un port ComfyUI déjà disponible.
Le port ComfyUI de la communauté exécute les checkpoints VDN-H3 publiés en tant que correctifs de modèle appliqués à l'exécution sur le nœud MiniMax-H3 natif de ComfyUI, sans aucune modification du cœur.
Comment Video DeltaNet accélère H3
Sur un modèle omni de pointe comme MiniMax H3, l'attention softmax sur de longues séquences de tokens représente plus de 85 % du temps d'exécution total, et son coût augmente de façon quadratique avec la longueur du clip. Video DeltaNet divise l'attention vidéo-vidéo en deux branches complémentaires : une branche softmax bidirectionnelle à fenêtre glissante qui préserve une attention exacte entre les images proches (détails fins et stabilité à court terme), et une branche d'attention linéaire bidirectionnelle qui achemine le contexte longue portée via un état récurrent à coût constant. Un schéma d'ancrage aux frontières en quatre points n'ajoute que 3,57 % de densité d'attention tout en maintenant la cohérence globale, si bien que la première et la dernière image d'un clip restent visibles par toutes les autres.
Le checkpoint ne remplace pas le backbone H3. Il embarque une branche d'attention linéaire distincte ainsi que deux petits adaptateurs LoRA qui fusionnent avec le backbone au moment de l'inférence, sans toucher aux poids d'origine. Outre le changement d'architecture, le modèle en 8 étapes est une distillation DMD du modèle en 50 étapes.
Performances et qualité
Les chiffres principaux proviennent de la configuration datacenter : sur 8 GPU B200, VDN-H3 génère un clip 768p de 14,4 secondes en 11,23 secondes, en 8 étapes de débruitage. Comparaisons sur un seul GPU par rapport à la référence H3 dense :
| Configuration | GPU | 50 NFE (VDN-H3-50-step) | 8 NFE (VDN-H3-8-step) |
|---|---|---|---|
| MiniMax-H3 dense (H200) | 1 | 27,3 min | 4,4 min |
| VDN-H3 FP8 (H200) | 1 | 9,4 min | 90,5 s |
| MiniMax-H3 dense (B200) | 1 | 13,95 min | 2,23 min |
| VDN-H3 FP8 (B200) | 1 | 5,3 min | 51 s |
L'équipe rapporte que les sorties du modèle hybride sont visuellement quasi impossibles à distinguer de celles du H3 dense, avec une qualité supérieure et un meilleur suivi des instructions que MiniMax FastH3. Des exemples de comparaison, notamment des clips côte à côte entre H3 dense et FastH3, sont disponibles sur la page du projet.
Extrait de sortie du VDN-H3 en 8 étapes, tiré de la page du projet.
Exécution dans ComfyUI
La version officielle cible une configuration datacenter : 8x B200 avec parallélisme de séquence Ulysses et noyaux FlashAttention-4 qui ne prennent en charge que Hopper et les Blackwell datacenter. Aucune version Windows officielle n'est disponible et le Blackwell grand public (sm_120) n'est pas pris en charge par les noyaux FA4.
Le port ComfyUI-VDN-H3 reproduit les calculs officiels d'attention hybride sous forme de correctifs de modèle appliqués à l'exécution sur le modèle MiniMax-H3 natif de ComfyUI, en remplaçant les couches linéaires FP8 et les noyaux Triton fusionnés par des équivalents PyTorch portables. Il est couvert par des tests unitaires le comparant à l'implémentation officielle et ne nécessite aucune nouvelle dépendance. Pour l'installer :
- Clonez le dépôt dans
ComfyUI/custom_nodes/puis redémarrez ComfyUI. - Téléchargez le checkpoint de l'étape souhaitée dans
ComfyUI/models/vdn/, en conservant l'arborescence des dossiers intacte (model_spec.json,linear_branch/,adapters/) :
hf download OpenVDN/vdn-minimax-h3 --include "stage-dmd-step-250/*" --local-dir <ComfyUI>/models/vdnLe téléchargement du checkpoint en 8 étapes stage-dmd-step-250 pèse environ 5 Go (branche linéaire et adaptateurs compris) ; la variante en 50 étapes stage-b-step-2000 pèse environ 4,3 Go.
Ce que le port n'apporte pas, c'est le niveau de vitesse annoncé : le facteur officiel de 74,5x combine le parallélisme sur 8 GPU, FA4, FP8 et la distillation en 8 étapes. La mesure du projet officiel sur GPU unique est d'environ 2,6x en 50 étapes, et les noyaux portables du port se situent un peu en dessous (environ 17 s/it en 1280x736 / 145 images sur une RTX 5090). Les benchmarks de la communauté dans les canaux H3 de Banodoco ont chronométré le VDN-H3 Turbo en 8 étapes à 2:04 pour du 1280x736, contre 1:24 pour le modèle LightXv2 turbo en 4 étapes sur le même matériel, des commentateurs notant que VDN préserve mieux les mouvements rapides que l'option FastH3.
Même invite avec le H3 dense en 50 étapes (haut de la comparaison sur la page du projet).
Disponibilité
- Poids : OpenVDN/vdn-minimax-h3 sur Hugging Face (Licence communautaire MiniMax H3 ; à noter qu'elle exclut certains territoires)
- Code officiel : OpenVDN/vdn-minimax-h3 (Apache-2.0), avec les codes d'inférence et d'entraînement et une page du projet
- Port ComfyUI : Saganaki22/ComfyUI-VDN-H3
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.