Edit Anything v2: Edición de Vídeo Multi-Instrucción para LTX-2.5
Edit Anything v2 lleva edición de vídeo multi-instrucción a LTX-2.5: Reemplazar, Eliminar, Agregar y Rediseñar en un solo prompt con IC-LoRA rango-128 y flujo ComfyUI.
Qué hay de nuevo en v2
El primer lanzamiento de Edit Anything (junio, cubierto aquí) se dirigió a LTX-2.3 con tres pistas separadas: transferencia de movimiento, una LoRA multitarea sin referencia y una construcción V2V de referencia. Edit Anything v2 es un reinicio limpio:
- Construido sobre LTX-2.5 — entrenado desde cero en LTX-2.5 22B dev, no una continuación de las LoRAs de LTX-2.3. 2750 pares de vídeo fuente/editados alineados, rango 128 / alfa 128, en 704×384, 73 fotogramas.
- Múltiples operaciones en un solo prompt — "Replace the purple Dodge Challenger with a green Lamborghini, and Add a cinematic apocalyptic scene with falling bombs, and Restyle the sky into a sunset" todo en un solo pase. v1 solo podía hacer una operación a la vez.
- Sin imagen de referencia — el vídeo fuente entra como guía, la instrucción entra como texto, el vídeo editado sale. Sin trucos RoPE, sin módulos sidecar, sin máscaras de pérdida.
- Mejorador de prompt — escribe en lenguaje natural y se convierte en el prompt de instrucción adecuado.
Ejemplos
Cada clip es una comparación de tres paneles: guía fuente | primer pase | segundo pase (upscaled).
Reemplazar el fondo, mantener al bailarín
edit_anything: Replace the green indoor background with a sandy beach under a bright sky, where the man dances in dark blue swim trunks and a white beach towel draped over his shoulder, holding a yellow inflatable ring around his waist.Reemplazar un coche + mantener al sujeto
edit_anything: Replace the purple Dodge Challenger in the background with a green Lamborghini Huracan, featuring black five-spoke wheels and a low front splitter. The woman remains fully visible throughout the video, wearing her brown suit as she dances in the foreground.Dos ediciones a la vez
edit_anything: Replace the woman's dark black hair with vibrant red hair. Add a metallic leather metalworker outfit, including a sleeveless top and pants, worn by her in the center of the frame.Uso en ComfyUI
Carga workflows/EditAnythingLTX2.5.json del repositorio de Hugging Face, o cáblalo a mano con el nodo BFSnodes LTX Multiple Controls. Configuraciones que coinciden con el entrenamiento:
| entrada | valor |
|---|---|
guide_video | tu vídeo fuente |
guide_source_id | 0 |
guide_layout | overlap |
guide_ref_resize_mode | match_target |
guide_downscale_factor | 1 |
Deja identity_image, mask_video y identity_mask_image desconectados — la LoRA fue entrenada sin ninguna de ellas.
Inicio sugerido: fuerza de LoRA 1.0, CFG 3–5, 30 pasos, sin LightX2V. La caja entrenada es 704×384, 73 fotogramas — otros tamaños y longitudes son extrapolación y degradan primero la consistencia temporal.
Reglas de prompts
Cada prompt comienza con el disparador edit_anything: seguido de una frase por edición. El modelo entiende solo cuatro verbos (de más a menos fiable): Reemplazar, Agregar, Eliminar, Rediseñar. Reglas importantes:
- 10 a 20 palabras por instrucción; más corto pierde descripción, más largo se desvía.
- Un objeto por
Agregar; para un grupo o multitud, usaReemplazaren una región existente en su lugar. - Ancla cada instrucción a algo visible ("a la izquierda del hombre", "en el escritorio en el lado derecho del marco").
- Describe estado, no modo — "parado en el campo de hierba verde", no "nadando graciosamente".
Rediseñarapunta a una región, no al clip completo; para un aspecto de vídeo completo, escribe dos o tres instrucciones de Rediseñar sobre las regiones que lo llevan.Hazlo <estilo>yConviértelo en <estilo>no funcionan — usaRediseñar.
Limitaciones
El vocabulario de edición se limita a los cuatro verbos; las ediciones que cambian muy poco del fotograma (eliminaciones sutiles) son las menos fiables; no hay soporte de imagen de referencia ("agregar este objeto" con una imagen permanece sin resolver); y los clips más largos que la caja entrenada pierden consistencia temporal primero. Como con v1, estos son experimentos de investigación — espera fallos e itera en el prompt.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.