Edit Anything v2: Edición de Vídeo Multi-Instrucción para LTX-2.5

ComfyUI Wikinews

Edit Anything v2 lleva edición de vídeo multi-instrucción a LTX-2.5: Reemplazar, Eliminar, Agregar y Rediseñar en un solo prompt con IC-LoRA rango-128 y flujo ComfyUI.

Editar Todo v2 (Hugging Face | Civitai) es una IC-LoRA de instrucciones de rango-128 para LTX-2.5 (22B dev) lanzada por Alissonerdx. A diferencia de las pistas anteriores de LTX-2.3, realiza varias operaciones de edición, Reemplazar, Eliminar, Agregar, Rediseñar en un solo prompt, no toma imagen de referencia y viene con un flujo de trabajo ComfyUI listo para usar.

Qué hay de nuevo en v2

El primer lanzamiento de Edit Anything (junio, cubierto aquí) se dirigió a LTX-2.3 con tres pistas separadas: transferencia de movimiento, una LoRA multitarea sin referencia y una construcción V2V de referencia. Edit Anything v2 es un reinicio limpio:

  • Construido sobre LTX-2.5 — entrenado desde cero en LTX-2.5 22B dev, no una continuación de las LoRAs de LTX-2.3. 2750 pares de vídeo fuente/editados alineados, rango 128 / alfa 128, en 704×384, 73 fotogramas.
  • Múltiples operaciones en un solo prompt — "Replace the purple Dodge Challenger with a green Lamborghini, and Add a cinematic apocalyptic scene with falling bombs, and Restyle the sky into a sunset" todo en un solo pase. v1 solo podía hacer una operación a la vez.
  • Sin imagen de referencia — el vídeo fuente entra como guía, la instrucción entra como texto, el vídeo editado sale. Sin trucos RoPE, sin módulos sidecar, sin máscaras de pérdida.
  • Mejorador de prompt — escribe en lenguaje natural y se convierte en el prompt de instrucción adecuado.

Ejemplos

Cada clip es una comparación de tres paneles: guía fuente | primer pase | segundo pase (upscaled).

Reemplazar el fondo, mantener al bailarín

edit_anything: Replace the green indoor background with a sandy beach under a bright sky, where the man dances in dark blue swim trunks and a white beach towel draped over his shoulder, holding a yellow inflatable ring around his waist.

Reemplazar un coche + mantener al sujeto

edit_anything: Replace the purple Dodge Challenger in the background with a green Lamborghini Huracan, featuring black five-spoke wheels and a low front splitter. The woman remains fully visible throughout the video, wearing her brown suit as she dances in the foreground.

Dos ediciones a la vez

edit_anything: Replace the woman's dark black hair with vibrant red hair. Add a metallic leather metalworker outfit, including a sleeveless top and pants, worn by her in the center of the frame.

Uso en ComfyUI

Carga workflows/EditAnythingLTX2.5.json del repositorio de Hugging Face, o cáblalo a mano con el nodo BFSnodes LTX Multiple Controls. Configuraciones que coinciden con el entrenamiento:

entradavalor
guide_videotu vídeo fuente
guide_source_id0
guide_layoutoverlap
guide_ref_resize_modematch_target
guide_downscale_factor1

Deja identity_image, mask_video y identity_mask_image desconectados — la LoRA fue entrenada sin ninguna de ellas.

Inicio sugerido: fuerza de LoRA 1.0, CFG 3–5, 30 pasos, sin LightX2V. La caja entrenada es 704×384, 73 fotogramas — otros tamaños y longitudes son extrapolación y degradan primero la consistencia temporal.

Reglas de prompts

Cada prompt comienza con el disparador edit_anything: seguido de una frase por edición. El modelo entiende solo cuatro verbos (de más a menos fiable): Reemplazar, Agregar, Eliminar, Rediseñar. Reglas importantes:

  • 10 a 20 palabras por instrucción; más corto pierde descripción, más largo se desvía.
  • Un objeto por Agregar; para un grupo o multitud, usa Reemplazar en una región existente en su lugar.
  • Ancla cada instrucción a algo visible ("a la izquierda del hombre", "en el escritorio en el lado derecho del marco").
  • Describe estado, no modo — "parado en el campo de hierba verde", no "nadando graciosamente".
  • Rediseñar apunta a una región, no al clip completo; para un aspecto de vídeo completo, escribe dos o tres instrucciones de Rediseñar sobre las regiones que lo llevan.
  • Hazlo <estilo> y Conviértelo en <estilo> no funcionan — usa Rediseñar.

Limitaciones

El vocabulario de edición se limita a los cuatro verbos; las ediciones que cambian muy poco del fotograma (eliminaciones sutiles) son las menos fiables; no hay soporte de imagen de referencia ("agregar este objeto" con una imagen permanece sin resolver); y los clips más largos que la caja entrenada pierden consistencia temporal primero. Como con v1, estos son experimentos de investigación — espera fallos e itera en el prompt.

Enlaces

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Edit Anything v2: Edición de Vídeo Multi-Instrucción para LTX-2.5 | ComfyUI Wiki