Accélération NVIDIA H3 : vidéo MiniMax H3 jusqu'à 27,7x plus rapide

ComfyUI Wikinews

Le moteur Sol de NVIDIA exécute MiniMax H3 en 4 étapes plus 3 de raffinement LTX : 6,85 s pour une vidéo 768p de 5 s, jusqu'à 27,7x plus rapide que SGLang.

Accélération Super MiniMax H3 (page officielle) est un pipeline du moteur Sol de NVIDIA de l'équipe NVIDIA SANA qui transforme la génération de vidéos MiniMax H3 en une tâche à deux étapes : un brouillon 896×512 en quatre étapes depuis H3 avec un LoRA de vitesse, puis une passe de raffinement LTX en trois étapes à la résolution cible avec Sol-Attn. Mesuré sur un seul NVIDIA GB200, une vidéo 1344×768 de 5 secondes se génère en 6,85 s et une vidéo de 10 secondes en 14,93 s ; 22,2× et 27,7× plus rapides que la référence SGLang publiée.
Accélération Super NVIDIA H3 : résultat de foule urbaine 1440p de 10 secondes

L'un des résultats autonomes 1440p sur la page NVIDIA (10 s, 2560×1440) : accélération à deux étapes, aucune référence correspondante n'a été enregistrée pour le 1440p.

Comment cela fonctionne

Au lieu d'exécuter de nombreuses étapes de débruitage H3 à pleine résolution, H3 Super Acceleration effectue la majeure partie du travail de génération dans un brouillon court basse résolution puis restaure les détails haute résolution avec une passe de raffinement légère. Chaque étape est une tâche, et les deux étapes s'exécutent sériellement sur un GB200 :

ÉtapeModèleRésolutionFPSÉtapesSortie
Étape 1 · brouillonMiniMax-H3 + LoRA de vitesse896×512244Vidéo brouillon
Étape 2 · raffinementLTX-2.5 + Sol-Attn768p / 1080p / 2K243Vidéo finale

L'étape 1 génère la vidéo initiale à 896×512 en quatre étapes de débruitage avec le LoRA LightX2V MiniMax-H3 Turbo. L'étape 2 met à l'échelle supérieure le brouillon vers la résolution de sortie demandée et exécute une passe Sol-Attn en trois étapes qui restaure les détails haute résolution et la cohérence. Le pipeline n'est pas bit-exact par rapport à la référence SGLang : il modifie le chemin d'échantillonnage, donc des différences peuvent apparaître dans les détails, la texture, le mouvement ou l'audio ; les vidéos jumelées sur la page NVIDIA vous permettent d'évaluer directement ce compromis.

Latence mesurée

Latence de bout en bout sur un NVIDIA GB200, avec les derniers résultats Sol-Super utilisant Sol-Attn pour le service complet de l'étape 2 :

RésolutionDuréeDiffusersSGLangSol EngineSol-Super E2Evs. SGLang
1344×7685 s167,8 s152,3 s45,4 s6,852 s22,2×
1344×76810 s468,2 s414,1 s132,5 s14,931 s27,7×

Les deux accélérations proviennent de sources différentes. L'étape 1 remplace le décodage VAE officiel H3 (3,427 s) par le décodeur léger TAEH3 (0,028 s), et l'étape 2 remplace le décodeur VAE vidéo dense LTX-2.5 (6,404 s dans un décodage apparié de 121 images) par le rafineur Sol-Attn et le décodage final LTX TAEHV. L'encodeur de l'étape 2 est intentionnellement laissé inchangé : le rafineur a été entraîné sur la distribution latente originale du VAE LTX-2.5.

À la sortie 768p, le débit mesuré équivaut à environ 525 vidéos de cinq secondes par heure sur un GB200 pleinement utilisé, contre 23,6 avec la référence SGLang.

Comparaison visuelle

La page NVIDIA associe chaque échantillon 768p et 1080p à une exécution de référence SGLang correspondante utilisant les mêmes entrées de génération :

Référence SGLangAccélération Super H3
Rue japonaise 768p 5 s, référence SGLangRue japonaise 768p 5 s, accéléré
Un homme et une femme échangent une remarque tendue sur une rue japonaise bondée (1344×768, 5 s)Mêmes entrées, 22,2× plus rapide
Référence SGLangAccélération Super H3
Forêt de bambous 1080p 5 s, référence SGLangForêt de bambous 1080p 5 s, accéléré
Deux artistes martiaux se font face dans une forêt de bambous (1080p, 5 s)Mêmes entrées, accéléré

Deux résultats autonomes 1440p (10 s, 2560×1440) ont également été publiés sans référence correspondante :

Disponibilité

Le pipeline est construit à partir de composants publics : le checkpoint officiel MiniMax-H3, le LoRA en quatre étapes LightX2V MiniMax-H3 Turbo utilisé pour le brouillon, le checkpoint LTX-2.5 pre-trained pré-entraîné, et les décodeurs légers TAEH3 et LTX TAEHV. Il s'exécute sur Sol Engine de NVIDIA avec Sol-Attn sur du matériel GB200, et est présenté comme une référence de production avec des benchmarks mesurés plutôt qu'un Pack de Nœuds ComfyUI. Au moment de la rédaction, il n'existe pas de Flux de travail ComfyUI officiel de NVIDIA pour ce pipeline ; des ports Communauté de composants individuels du moteur Sol (tels que le patching Sol-Attn) ont commencé à apparaître.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Accélération NVIDIA H3 : vidéo MiniMax H3 jusqu'à 27,7x plus rapide | ComfyUI Wiki