MiniMax H3 Turbo LoRA : Aperçu de la génération audio-vidéo en 4 étapes
Un LoRA de la communauté génère la vidéo MiniMax H3 avec un audio stéréo synchronisé en 4 étapes d'échantillonnage au lieu d'environ 20. La conversion ComfyUI et un exemple de flux de travail sont inclus.
Un LoRA de la communauté pour MiniMax H3 génère conjointement de la vidéo et un audio stéréo synchronisé en 4 étapes d'échantillonnage au lieu des ~20 habituelles, soit une accélération d'environ 5x du temps d'échantillonnage. Publié le 5 août par larryvrh en tant qu'aperçu précoce, il s'agit du premier LoRA de vitesse pour le modèle H3 à poids ouverts (lire l'article sur les poids ouverts).
Ceci est un prototype précoce. Les poids et les outils ComfyUI sont en cours de développement : 4 étapes fonctionnent mais donnent un résultat nettement plus doux, et 6 à 8 étapes constituent la zone de confort actuelle pour la netteté. Considérez-le comme un aperçu, pas comme un produit terminé.
Poids
Tous les fichiers sont en bf16, environ 744 Mo, et s'appliquent comme une mise à jour standard de bas rang (W_eff = W + lora_B @ lora_A, alpha est égal au rang, sans mise à l'échelle supplémentaire). Le LoRA cible le transformateur de base H3 ; les flux vidéo et audio fonctionnent sur deux planifications de flux différentes, donc un échantillonneur standard sur-échantillonne l'audio à 4 étapes et le casse. Le nœud échantillonneur personnalisé gère cela.
| Fichier | ~Étapes d'entraînement | Remarques |
|---|---|---|
minimax_h3_turbo_4step_ckpt500.safetensors | ~500 | Recommandé par défaut : le plus récent, le plus net (non-EMA) |
minimax_h3_turbo_4step_ema_ckpt500.safetensors | ~500 | Variante à moyenne temporelle : plus lisse, mais peut présenter du ghosting à ce checkpoint précoce |
minimax_h3_turbo_4step.safetensors | ~200 | Version initiale, non-EMA |
minimax_h3_turbo_4step_ema.safetensors | ~200 | Version initiale, à moyenne temporelle (remplacée) |
Le LoRA nécessite un checkpoint de base non élagué : le modèle de diffusion convrot bf16 ou INT8 complet. Les variantes élaguées utilisent une couche de conditionnement temporel différente et ne sont pas compatibles. Une conversion compatible avec les modèles élagués est disponible séparément (voir ci-dessous).
Utilisation de ComfyUI
La version originale nécessite des nœuds personnalisés (ComfyUI-MiniMax-H3-Turbo, installables via ComfyUI-Manager ou git clone dans custom_nodes) ainsi qu'un fichier minimax_h3_turbo_4step*.safetensors dans models/loras/ :
- Installez les nœuds personnalisés.
- Téléchargez un fichier
.safetensorsdansComfyUI/models/loras/. - Partez du flux de travail officiel de MiniMax H3 à poids ouverts, insérez le LoRA Turbo entre le chargeur de modèle et l'échantillonneur, puis remplacez l'échantillonneur par l'échantillonneur Turbo MiniMax-H3 (4 étapes) avec le scheduler réglé sur
simple.
Un flux de travail texte-vers-vidéo prêt à l'emploi est fourni dans le dépôt (minimax_h3_t2v_turbo.json) et dans les flux de travail d'exemple du dépôt de nœuds.
Ce n'est pas un support natif de ComfyUI : le LoRA de vitesse dépend des nœuds personnalisés tiers
ComfyUI-MiniMax-H3-Turbo.
Conversion du modèle élagué
Les checkpoints H3 élagués/forme courbe utilisés par ComfyUI nécessitent une conversion de clés. drbaph a publié minimax_h3_turbo_4step_ckpt500_pruned_comfyui.safetensors (plus une variante EMA) sur MiniMax-H3-Turbo-Lora-ComfyUI, qui se charge avec le chargeur de LoRA MiniMax-H3 intégré de ComfyUI, et a inclus un flux de travail d'exemple (fl_minimax_h3_turbo_lora_example_workflow.json). QrusherZA a également publié une conversion élaguée en un seul fichier sur H3_Turbo_ComfyUI.
Les premiers tests de la communauté avec une force de LoRA de 1,0 et Euler/Beta rapportent une sortie nette en 4 étapes ; le flux audio est le point faible actuel de ce checkpoint précoce.
Disponibilité
- Poids originaux : larryvrh/MiniMax-H3-Turbo-Lora (Apache-2.0)
- Nœuds personnalisés : Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Conversion du modèle élagué : drbaph/MiniMax-H3-Turbo-Lora-ComfyUI, QrusherZA/H3_Turbo_ComfyUI
- Catalogue : entrées Turbo LoRA ajoutées à la page du modèle MiniMax H3 avec le nœud personnalisé requis signalé
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.