Accélération NVIDIA H3 : vidéo MiniMax H3 jusqu'à 27,7x plus rapide
Le moteur Sol de NVIDIA exécute MiniMax H3 en 4 étapes plus 3 de raffinement LTX : 6,85 s pour une vidéo 768p de 5 s, jusqu'à 27,7x plus rapide que SGLang.
L'un des résultats autonomes 1440p sur la page NVIDIA (10 s, 2560×1440) : accélération à deux étapes, aucune référence correspondante n'a été enregistrée pour le 1440p.
Comment cela fonctionne
Au lieu d'exécuter de nombreuses étapes de débruitage H3 à pleine résolution, H3 Super Acceleration effectue la majeure partie du travail de génération dans un brouillon court basse résolution puis restaure les détails haute résolution avec une passe de raffinement légère. Chaque étape est une tâche, et les deux étapes s'exécutent sériellement sur un GB200 :
| Étape | Modèle | Résolution | FPS | Étapes | Sortie |
|---|---|---|---|---|---|
| Étape 1 · brouillon | MiniMax-H3 + LoRA de vitesse | 896×512 | 24 | 4 | Vidéo brouillon |
| Étape 2 · raffinement | LTX-2.5 + Sol-Attn | 768p / 1080p / 2K | 24 | 3 | Vidéo finale |
L'étape 1 génère la vidéo initiale à 896×512 en quatre étapes de débruitage avec le LoRA LightX2V MiniMax-H3 Turbo. L'étape 2 met à l'échelle supérieure le brouillon vers la résolution de sortie demandée et exécute une passe Sol-Attn en trois étapes qui restaure les détails haute résolution et la cohérence. Le pipeline n'est pas bit-exact par rapport à la référence SGLang : il modifie le chemin d'échantillonnage, donc des différences peuvent apparaître dans les détails, la texture, le mouvement ou l'audio ; les vidéos jumelées sur la page NVIDIA vous permettent d'évaluer directement ce compromis.
Latence mesurée
Latence de bout en bout sur un NVIDIA GB200, avec les derniers résultats Sol-Super utilisant Sol-Attn pour le service complet de l'étape 2 :
| Résolution | Durée | Diffusers | SGLang | Sol Engine | Sol-Super E2E | vs. SGLang |
|---|---|---|---|---|---|---|
| 1344×768 | 5 s | 167,8 s | 152,3 s | 45,4 s | 6,852 s | 22,2× |
| 1344×768 | 10 s | 468,2 s | 414,1 s | 132,5 s | 14,931 s | 27,7× |
Les deux accélérations proviennent de sources différentes. L'étape 1 remplace le décodage VAE officiel H3 (3,427 s) par le décodeur léger TAEH3 (0,028 s), et l'étape 2 remplace le décodeur VAE vidéo dense LTX-2.5 (6,404 s dans un décodage apparié de 121 images) par le rafineur Sol-Attn et le décodage final LTX TAEHV. L'encodeur de l'étape 2 est intentionnellement laissé inchangé : le rafineur a été entraîné sur la distribution latente originale du VAE LTX-2.5.
À la sortie 768p, le débit mesuré équivaut à environ 525 vidéos de cinq secondes par heure sur un GB200 pleinement utilisé, contre 23,6 avec la référence SGLang.
Comparaison visuelle
La page NVIDIA associe chaque échantillon 768p et 1080p à une exécution de référence SGLang correspondante utilisant les mêmes entrées de génération :
| Référence SGLang | Accélération Super H3 |
|---|---|
![]() | ![]() |
| Un homme et une femme échangent une remarque tendue sur une rue japonaise bondée (1344×768, 5 s) | Mêmes entrées, 22,2× plus rapide |
| Référence SGLang | Accélération Super H3 |
|---|---|
![]() | ![]() |
| Deux artistes martiaux se font face dans une forêt de bambous (1080p, 5 s) | Mêmes entrées, accéléré |
Deux résultats autonomes 1440p (10 s, 2560×1440) ont également été publiés sans référence correspondante :
Disponibilité
Le pipeline est construit à partir de composants publics : le checkpoint officiel MiniMax-H3, le LoRA en quatre étapes LightX2V MiniMax-H3 Turbo utilisé pour le brouillon, le checkpoint LTX-2.5 pre-trained pré-entraîné, et les décodeurs légers TAEH3 et LTX TAEHV. Il s'exécute sur Sol Engine de NVIDIA avec Sol-Attn sur du matériel GB200, et est présenté comme une référence de production avec des benchmarks mesurés plutôt qu'un Pack de Nœuds ComfyUI. Au moment de la rédaction, il n'existe pas de Flux de travail ComfyUI officiel de NVIDIA pour ce pipeline ; des ports Communauté de composants individuels du moteur Sol (tels que le patching Sol-Attn) ont commencé à apparaître.




Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.