ComfyUI H3 Motion Context Auto-Chain: lip-sync en una sola ejecución
Addon de ComfyUI-H3-Motion-Context que encadena clips de lip-sync de MiniMax H3: divide el audio, continúa el movimiento y el audio por el contexto latente y une todo en un MP4.
Fotograma de ejemplo de la demo de lip-sync con auto-chain publicada por el autor.
El problema que resuelve
La generación de MiniMax H3 está limitada a clips de unos 20 segundos, así que un vídeo de lip-sync más largo normalmente significa encadenar ejecuciones de ComfyUI a mano: lanzar una generación nueva cada 20 segundos, ajustar los tamaños para que quepan en VRAM y unir las piezas después. El addon Auto-Chain automatiza ese bucle. Corta el audio completo en trozos del tamaño de un clip, conserva la línea de tiempo original para una unión sin huecos, pone en cola el siguiente clip automáticamente y lleva la continuidad de vídeo y audio a través del contexto latente de H3 para que cada clip continúe desde el anterior.
La demo del autor (TBG ETUR en YouTube) muestra un vídeo de lip-sync largo construido a partir de clips encadenados, incluido movimiento de cámara dirigido por prompts por clip:
Nodos incluidos
| Nodo | Qué hace |
|---|---|
| H3 Auto Chain Audio | divide el audio en trozos del tamaño de un clip y emite el audio, prompt, número de clip y configuración de cadena actuales |
| H3 Auto Chain Load Latent | carga el latente de vídeo/audio H3 del clip anterior para el nodo Motion Context |
| H3 Auto Chain Save Latent | guarda la salida actual del sampler en una ranura numerada para la continuación |
| H3 Auto Chain Frame Reference | suministra la imagen de referencia: la imagen inicial en cada clip, el último fotograma del clip anterior (last_frame, recomendado), o solo para el clip 1 |
| H3 Auto Chain Motion Context | delega en el nodo Motion Context original para los clips de continuación, con paso directo en el primer clip |
| H3 Auto Chain + Stitch | guarda el clip actual, extrae su último fotograma, pone en cola el siguiente clip y une todos los clips completados en un MP4 al terminar la cadena |
Los prompts por clip funcionan con un style_prompt compartido más clip_prompts numerados ([1] The character walks through a rainy city street., [2] The character enters a warm cafe., ...), y cada segmento tiene su propio archivo de salida, de modo que se puede reanudar una cadena o volver a renderizar un solo clip con el mismo chain_id.
Flujo de trabajo de ejemplo
El repositorio incluye un flujo de trabajo de lip-sync completo que conecta los nodos del addon con el paquete H3 Motion Context original:
Configuración inicial recomendada: trozos de 20 segundos, 24 fps, 22 fotogramas de contexto, modo de referencia last_frame.
Instalación
El addon requiere el paquete original ComfyUI-H3-Motion-Context y un flujo de trabajo de vídeo MiniMax H3 funcional. Instala ambas carpetas en ComfyUI/custom_nodes/ y reinicia ComfyUI:
ComfyUI/custom_nodes/ComfyUI-H3-Motion-Context-orig/
ComfyUI/custom_nodes/ComfyUI-H3-Motion-Context-Auto-Chain-addon/El fork H3 modificado experimental no debe instalarse junto con el paquete original y este addon, porque registra IDs de nodo duplicados.
Disponibilidad
- Código: Ltamann/ComfyUI-H3-Motion-Context-Auto-Chain-addon en GitHub
- Flujo de trabajo:
MiniMax H3 Lipsync.jsonenexample_workflows/ - Demo: TBG ETUR en YouTube
Comentarios
Inicia sesión con GitHub para unirte a la conversación.