MiniMax H3 Prompt Rewriter LoRA : réécriture locale de prompts T2VA
Le MiniMax-H3-Prompt-Rewriter-LoRA de Lightx2v transforme les prompts courts en descriptions T2VA structurées en local, avec des nœuds ComfyUI pour Qwen3.6-27B.
L'équipe Lightx2v a publié MiniMax-H3-Prompt-Rewriter-LoRA (Hugging Face), un adaptateur LoRA affiné sur Qwen3.6-27B qui réécrit les prompts courts en descriptions audio-vidéo structurées attendues par MiniMax H3. C'est une alternative locale au flux de travail de prompts Context-IR hébergé par MiniMax : fournissez-lui un prompt ainsi qu'un format d'image et une durée, et il génère un bloc integrated_multimodal_description, overall_soundscape et non_diegetic_music plan par plan, prêt pour la génération H3.
Le nœud de réécriture de prompts dans ComfyUI : prompt court en entrée, description structurée plan par plan, paysage sonore et musique en sortie.
Ce qu'il fait
L'adaptateur convertit un prompt court, le format d'image demandé et la durée en une description audio-vidéo H3 structurée :
Original prompt + aspect ratio + duration
│
▼
Qwen3.6-27B + this LoRA
│
▼
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...La réécriture développe la structure des plans, le minutage, la composition, les mouvements de caméra, l'action physique et la continuité, et ajoute un son diégétique synchronisé ainsi qu'une musique non diégétique, tout en préservant l'intention d'origine. La version actuelle prend en charge la réécriture T2VA textuelle uniquement ; les réécritures premier/dernier plan vers vidéo (FL2VA) et référence vers vidéo (Ref2VA) sont sur la feuille de route. Notez qu'il s'agit d'une approximation apprise du service officiel H3-Context-IR, et non d'une réplique exacte.
Nœuds ComfyUI
Le membre de la communauté pytraveler a empaqueté la LoRA sous le nom de MiniMax-H3-Prompt-Rewriter-ComfyUI (GitHub), installable via ComfyUI-Manager ou en clonant le dépôt dans ComfyUI/custom_nodes/. Le pack fournit trois groupes de nœuds :
- Nœud Rewriter : exécute Qwen3.6-27B avec la LoRA, l'implémentation de référence du format de réécriture
- Nœuds Writer : produisent la même sortie structurée à partir de n'importe quel GGUF suivant les instructions, couvrant T2VA, I2VA, FL2VA, L2VA et Ref2VA avec un téléchargement d'environ 2,6 Go et ~5 Go de VRAM
- Nœuds Reference Caption / Multi Reference Caption : transforment une image, un clip audio ou une vidéo en texte de légende dont les nœuds Writer ont besoin
Exigences matérielles
La voie LoRA charge un modèle de base de 27 milliards de paramètres : environ 16 Go de VRAM en nf4, ~28 Go en int8, ou 13 à 19 Go via la quantification GGUF avec déchargement des couches. La communauté demande déjà à Lightx2v une variante 4B/8B pour abaisser le seuil d'entrée.
Disponibilité
La LoRA est un adaptateur côté texte : elle réécrit les prompts et n'inclut pas les poids du générateur MiniMax-H3. Utilisez-la avec l'inférence LightX2V ou le pack de nœuds ComfyUI ci-dessus ; le prompt réécrit alimente MiniMax-H3 comme d'habitude. Le modèle de base 27B est téléchargé depuis Hugging Face lors de la première utilisation.
Comparaison
Les vidéos ci-dessous comparent le même checkpoint MiniMax-H3 avec des paramètres d'inférence identiques ; seule la méthode de réécriture des prompts diffère : le prompt brut (sans réécriture) contre Qwen3.6-27B avec la LoRA H3-T2VA Context Rewriter.
| Prompt d'origine (sans réécriture) | H3-T2VA Context Rewriter LoRA |
|---|---|
| Teaser de space-opéra épique, prompt brut | Même prompt, réécrit par la LoRA |
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.