VDN-H3 : vidéo MiniMax H3 accélérée par attention hybride

ComfyUI Wikinews

Le checkpoint Video DeltaNet d'OpenVDN pour MiniMax H3 génère un clip 768p de 14,4 s en 8 étapes, avec un port ComfyUI déjà disponible.

VDN-H3 (poids, code) est une refonte de MiniMax H3 à attention hybride, réalisée par une équipe de UC Berkeley / Impossible, Inc. / UT Austin. Elle remplace l'attention longue portée quadratique de H3 par une branche d'attention linéaire « Video Delta Attention », est fournie sous forme d'un checkpoint en 50 étapes et d'un checkpoint distillé en 8 étapes, qui se greffent sur le backbone H3 non modifié, et fait état d'une qualité quasi sans perte par rapport au H3 dense. Un port natif ComfyUI est déjà disponible : Saganaki22/ComfyUI-VDN-H3.
VDN-H3 s'exécutant comme nœud natif ComfyUI

Le port ComfyUI de la communauté exécute les checkpoints VDN-H3 publiés en tant que correctifs de modèle appliqués à l'exécution sur le nœud MiniMax-H3 natif de ComfyUI, sans aucune modification du cœur.

Comment Video DeltaNet accélère H3

Sur un modèle omni de pointe comme MiniMax H3, l'attention softmax sur de longues séquences de tokens représente plus de 85 % du temps d'exécution total, et son coût augmente de façon quadratique avec la longueur du clip. Video DeltaNet divise l'attention vidéo-vidéo en deux branches complémentaires : une branche softmax bidirectionnelle à fenêtre glissante qui préserve une attention exacte entre les images proches (détails fins et stabilité à court terme), et une branche d'attention linéaire bidirectionnelle qui achemine le contexte longue portée via un état récurrent à coût constant. Un schéma d'ancrage aux frontières en quatre points n'ajoute que 3,57 % de densité d'attention tout en maintenant la cohérence globale, si bien que la première et la dernière image d'un clip restent visibles par toutes les autres.

Le checkpoint ne remplace pas le backbone H3. Il embarque une branche d'attention linéaire distincte ainsi que deux petits adaptateurs LoRA qui fusionnent avec le backbone au moment de l'inférence, sans toucher aux poids d'origine. Outre le changement d'architecture, le modèle en 8 étapes est une distillation DMD du modèle en 50 étapes.

Performances et qualité

Les chiffres principaux proviennent de la configuration datacenter : sur 8 GPU B200, VDN-H3 génère un clip 768p de 14,4 secondes en 11,23 secondes, en 8 étapes de débruitage. Comparaisons sur un seul GPU par rapport à la référence H3 dense :

ConfigurationGPU50 NFE (VDN-H3-50-step)8 NFE (VDN-H3-8-step)
MiniMax-H3 dense (H200)127,3 min4,4 min
VDN-H3 FP8 (H200)19,4 min90,5 s
MiniMax-H3 dense (B200)113,95 min2,23 min
VDN-H3 FP8 (B200)15,3 min51 s

L'équipe rapporte que les sorties du modèle hybride sont visuellement quasi impossibles à distinguer de celles du H3 dense, avec une qualité supérieure et un meilleur suivi des instructions que MiniMax FastH3. Des exemples de comparaison, notamment des clips côte à côte entre H3 dense et FastH3, sont disponibles sur la page du projet.

Extrait de sortie du VDN-H3 en 8 étapes, tiré de la page du projet.

Exécution dans ComfyUI

La version officielle cible une configuration datacenter : 8x B200 avec parallélisme de séquence Ulysses et noyaux FlashAttention-4 qui ne prennent en charge que Hopper et les Blackwell datacenter. Aucune version Windows officielle n'est disponible et le Blackwell grand public (sm_120) n'est pas pris en charge par les noyaux FA4.

Le port ComfyUI-VDN-H3 reproduit les calculs officiels d'attention hybride sous forme de correctifs de modèle appliqués à l'exécution sur le modèle MiniMax-H3 natif de ComfyUI, en remplaçant les couches linéaires FP8 et les noyaux Triton fusionnés par des équivalents PyTorch portables. Il est couvert par des tests unitaires le comparant à l'implémentation officielle et ne nécessite aucune nouvelle dépendance. Pour l'installer :

  1. Clonez le dépôt dans ComfyUI/custom_nodes/ puis redémarrez ComfyUI.
  2. Téléchargez le checkpoint de l'étape souhaitée dans ComfyUI/models/vdn/, en conservant l'arborescence des dossiers intacte (model_spec.json, linear_branch/, adapters/) :
hf download OpenVDN/vdn-minimax-h3 --include "stage-dmd-step-250/*" --local-dir <ComfyUI>/models/vdn

Le téléchargement du checkpoint en 8 étapes stage-dmd-step-250 pèse environ 5 Go (branche linéaire et adaptateurs compris) ; la variante en 50 étapes stage-b-step-2000 pèse environ 4,3 Go.

Ce que le port n'apporte pas, c'est le niveau de vitesse annoncé : le facteur officiel de 74,5x combine le parallélisme sur 8 GPU, FA4, FP8 et la distillation en 8 étapes. La mesure du projet officiel sur GPU unique est d'environ 2,6x en 50 étapes, et les noyaux portables du port se situent un peu en dessous (environ 17 s/it en 1280x736 / 145 images sur une RTX 5090). Les benchmarks de la communauté dans les canaux H3 de Banodoco ont chronométré le VDN-H3 Turbo en 8 étapes à 2:04 pour du 1280x736, contre 1:24 pour le modèle LightXv2 turbo en 4 étapes sur le même matériel, des commentateurs notant que VDN préserve mieux les mouvements rapides que l'option FastH3.

Même invite avec le H3 dense en 50 étapes (haut de la comparaison sur la page du projet).

Disponibilité

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
VDN-H3 : vidéo MiniMax H3 accélérée par attention hybride | ComfyUI Wiki