ComfyUI H3 Motion Context Auto-Chain : lip-sync en une seule exécution
Addon pour ComfyUI-H3-Motion-Context qui enchaîne les clips de lip-sync MiniMax H3 : découpage de l'audio, continuation via le contexte latent, assemblage en un seul MP4.
Image d'exemple de la démo de lip-sync en auto-chain publiée par l'auteur.
Le problème résolu
La génération MiniMax H3 est limitée à des clips d'environ 20 secondes, donc un lip-sync plus long signifie normalement enchaîner les exécutions ComfyUI à la main : lancer une nouvelle génération toutes les 20 secondes, redimensionner pour tenir dans la VRAM, puis joindre les morceaux. L'addon Auto-Chain automatise cette boucle. Il découpe l'audio complet en morceaux de la taille d'un clip, conserve la timeline d'origine pour un assemblage sans coupure, met automatiquement le clip suivant en file d'attente et fait passer la continuité vidéo et audio à travers le contexte latent H3, si bien que chaque clip continue depuis le précédent.
La démo de l'auteur (TBG ETUR sur YouTube) montre un long lip-sync construit à partir de clips enchaînés, avec des mouvements de caméra pilotés par des prompts par clip :
Nœuds inclus
| Nœud | Ce qu'il fait |
|---|---|
| H3 Auto Chain Audio | découpe l'audio en morceaux de la taille d'un clip et sort l'audio, le prompt, le numéro de clip et la configuration de chaîne courants |
| H3 Auto Chain Load Latent | charge le latent vidéo/audio H3 du clip précédent pour le nœud Motion Context |
| H3 Auto Chain Save Latent | enregistre la sortie courante du sampler dans un emplacement numéroté pour la continuation |
| H3 Auto Chain Frame Reference | fournit l'image de référence : l'image initiale à chaque clip, la dernière image du clip précédent (last_frame, recommandé), ou seulement pour le clip 1 |
| H3 Auto Chain Motion Context | délègue au nœud Motion Context d'origine pour les clips de continuation, avec passage direct au premier clip |
| H3 Auto Chain + Stitch | enregistre le clip courant, extrait sa dernière image, met le clip suivant en file d'attente et assemble tous les clips terminés en un seul MP4 à la fin de la chaîne |
Le prompting par clip fonctionne avec un style_prompt partagé plus des clip_prompts numérotés ([1] The character walks through a rainy city street., [2] The character enters a warm cafe., ...), et chaque segment possède son propre fichier de sortie, ce qui permet de reprendre une chaîne ou de re-rendre un seul clip avec le même chain_id.
Workflow d'exemple
Le dépôt fournit un workflow de lip-sync complet qui connecte les nœuds de l'addon au package H3 Motion Context d'origine :
Réglages de départ recommandés : morceaux de 20 secondes, 24 fps, 22 images de contexte, mode de référence last_frame.
Installation
L'addon nécessite le package d'origine ComfyUI-H3-Motion-Context et un workflow vidéo MiniMax H3 fonctionnel. Installez les deux dossiers dans ComfyUI/custom_nodes/ et redémarrez ComfyUI :
ComfyUI/custom_nodes/ComfyUI-H3-Motion-Context-orig/
ComfyUI/custom_nodes/ComfyUI-H3-Motion-Context-Auto-Chain-addon/Le fork H3 modifié expérimental ne doit pas être installé en parallèle du package d'origine et de cet addon, car il enregistre des identifiants de nœud en double.
Disponibilité
- Code : Ltamann/ComfyUI-H3-Motion-Context-Auto-Chain-addon sur GitHub
- Workflow :
MiniMax H3 Lipsync.jsondansexample_workflows/ - Démo : TBG ETUR sur YouTube
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.