H3 Motion Context v0.2.0: Encadenado sin costuras de clips MiniMax H3
H3 Motion Context v0.2.0 encadena clips MiniMax H3: el movimiento y el audio continúan entre cortes, añade el modo de referencia y elimina la costura visible.
H3 Motion Context lanzó la v0.2.0 el 9 de agosto. El paquete de nodos personalizados encadena clips MiniMax H3 en ComfyUI para que el movimiento y el audio continúen realmente a través del corte: genera el clip A, alimenta el nodo con sus últimos fotogramas y audio, y el clip B retoma donde terminó A, con el mismo movimiento, la misma velocidad y la misma dirección, con el audio continuado en lugar de resintetizado.
Novedades de la v0.2.0
- Sin costura visible. Con
context_latentconectado, los fotogramas fijados se extraen directamente del latente del clip anterior en lugar de decodificarse a píxeles y volver a codificarse. Sin cambio de color, sin salto de contraste en la unión, y es más rápido porque omite una decodificación, un redimensionado y una pasada de VAE. - El modo de referencia funciona con el encadenado. Ahora, un gráfico Ref2VA conserva sus propias referencias de imagen, vídeo y audio mientras el audio de continuación se añade junto a ellas. Antes, el nodo sobrescribía la lista de referencias, por lo que activar el encadenado descartaba silenciosamente todas las referencias. El diseño es de seitanism (del hilo de extensión sin costuras Banodoco MiniMax H3), implementado por primera vez en el fork de @ethanfel; esta implementación es independiente, pero da crédito a ambos.
- Ventana de contexto de 56 fotogramas, junto con 5, 22 y 39.
- Dos configuraciones en lugar de seis.
context_lengthyaudio_context_length; el resto son constantes con valores predeterminados claros. - El audio fijado se ajusta a la cuadrícula de audio, corrigiendo un desalineamiento de un tercio de paso en algunas combinaciones de ventana y duración de clip.
- Los parches se instalan en el primer uso, no en la importación, y están restringidos a los gráficos propios de este paquete, por lo que los demás flujos de trabajo H3 no se ven afectados.
- La resolución no puede cambiar a mitad de cadena mientras se usa
context_latent: el nodo se niega e indica ambas resoluciones en lugar de recurrir silenciosamente a la ruta con pérdida.
Cómo funciona
MiniMax H3 puede fijar un fotograma en una coordenada de tiempo y reinyectarlo en cada paso de muestreo; el único obstáculo para el encadenado era una comprobación en ComfyUI que rechazaba cualquier fotograma fijado que no fuera el primero o el último. El paquete elimina esa restricción con un parche en tiempo de ejecución (no se edita nada en el disco), y los parches verifican sus suposiciones contra el código actual de ComfyUI en cada inicio: una negativa contundente es mejor que una renderización silenciosamente defectuosa.
La parte más difícil es el audio, ya que H3 genera imagen y sonido juntos: el nodo transporta el contexto de audio del clip anterior para que el siguiente segmento continúe el mismo audio en lugar de producir un sonido similar.
Flujo de trabajo
El lanzamiento de la v0.2.0 incluye un flujo de trabajo combinado que ejecuta tanto la ruta fl2va como la ref2va en un solo gráfico:
Disponibilidad
Instala colocando la carpeta en ComfyUI/custom_nodes/ y reinicia. Ten en cuenta que los valores de los widgets cambiaron en la 0.2.0: los flujos de trabajo guardados con la 0.1 cargarán los números en los campos incorrectos, así que elimina y vuelve a añadir el nodo Motion Context. Además, ejecuta solo un paquete de encadenado H3 a la vez: varios paquetes eliminan la misma restricción de primer/último fotograma clave, y este nodo ahora se niega a ejecutarse si otro paquete ya lo ha reclamado.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.