Edit Anything v2 : Édition vidéo multi-instructions pour LTX-2.5

ComfyUI Wikinews

Edit Anything v2 apporte l'édition vidéo multi-instructions à LTX-2.5 : Remplacer, Supprimer, Ajouter et Redessiner en une invite via une IC-LoRA rang-128 et un flux ComfyUI.

Edit Anything v2 (Hugging Face | Civitai) est un IC-LoRA d'instruction de rang-128 pour LTX-2.5 (22B dev) publié par Alissonerdx. Contrairement aux pistes antérieures de LTX-2.3, il effectue plusieurs opérations d'édition : Remplacer, Supprimer, Ajouter, Redessiner dans une seule invite, ne prend pas d'image de référence et est livré avec un flux de travail ComfyUI prêt à l'emploi.

Ce qui est nouveau dans la v2

La première publication Edit Anything (juin, décrite ici) visait LTX-2.3 avec trois pistes distinctes : transfert de mouvement, un LoRA multitâche sans référence, et une construction V2V de référence. Edit Anything v2 est un redémarrage propre :

  • Construit sur LTX-2.5 — entraîné à partir de zéro sur LTX-2.5 22B dev, pas une continuation des LoRAs LTX-2.3. 2750 paires de vidéos source/modifiées alignées, rang 128 / alpha 128, à 704×384, 73 images.
  • Plusieurs opérations en une seule invite — « Remplacer le Dodge Challenger violet par une Lamborghini verte, et Ajouter une scène cinématographique apocalyptique avec des bombes qui tombent, et Redessiner le ciel en coucher de soleil » tout en un seul passage. La v1 ne pouvait faire qu'une opération à la fois.
  • Pas d'image de référence — la vidéo source entre comme guide, l'instruction entre comme texte, la vidéo modifiée sort. Pas d'astuces RoPE, pas de modules sidecar, pas de masques de perte.
  • Améliorateur d'invite — écrivez en langage naturel et il est converti en l'invite d'instruction appropriée.

Exemples

Chaque clip est une comparaison à trois panneaux : guide source | premier passage | deuxième passage (upscaled).

Remplacer l'arrière-plan, garder le danseur

edit_anything: Replace the green indoor background with a sandy beach under a bright sky, where the man dances in dark blue swim trunks and a white beach towel draped over his shoulder, holding a yellow inflatable ring around his waist.

Remplacer une voiture + garder le sujet

edit_anything: Replace the purple Dodge Challenger in the background with a green Lamborghini Huracan, featuring black five-spoke wheels and a low front splitter. The woman remains fully visible throughout the video, wearing her brown suit as she dances in the foreground.

Deux modifications à la fois

edit_anything: Replace the woman's dark black hair with vibrant red hair. Add a metallic leather metalworker outfit, including a sleeveless top and pants, worn by her in the center of the frame.

Utilisation dans ComfyUI

Chargez workflows/EditAnythingLTX2.5.json depuis le dépôt Hugging Face, ou connectez-le à la main avec le nœud BFSnodes LTX Multiple Controls. Paramètres correspondant à l'entraînement :

EntréeValeur
guide_videovotre vidéo source
guide_source_id0
guide_layoutoverlap
guide_ref_resize_modematch_target
guide_downscale_factor1

Laissez identity_image, mask_video et identity_mask_image déconnectés : le LoRA a été entraîné sans aucun d'eux.

Départ suggéré : force du LoRA 1.0, CFG 3–5, 30 étapes, pas de LightX2V. La boîte entraînée est 704×384, 73 images : les autres tailles et durées sont une extrapolation et perdent en cohérence temporelle en premier.

Règles de formulation des invites

Chaque invite commence par le déclencheur edit_anything: suivi d'une phrase par modification. Le modèle comprend seulement quatre verbes (du plus au moins fiable) : Remplacer, Ajouter, Supprimer, Redessiner. Règles importantes :

  • 10 à 20 mots par instruction ; plus court perd la description, plus long dérive.
  • Un objet par Ajouter ; pour un groupe ou une foule, utilisez Remplacer sur une région existante à la place.
  • Ancrer chaque instruction à quelque chose de visible (« à gauche de l'homme », « sur le bureau du côté droit du cadre »).
  • Décrire l'état, pas la manière : « debout dans le champ d'herbe verte », pas « nager gracieusement ».
  • Restyle cible une région, pas le clip entier ; pour un look vidéo complet, écrivez deux ou trois instructions Restyle sur les régions qui le portent.
  • Make it <style> et Turn it into <style> ne fonctionnent pas : utilisez Restyle.

Limitations

Le vocabulaire d'édition est limité aux quatre verbes ; les modifications qui changent très peu de l'image (suppressions subtiles) sont les moins fiables ; il n'y a pas de prise en charge de l'image de référence (« ajouter cet objet » avec une image reste non résolu) ; et les clips plus longs que la boîte entraînée perdent la cohérence temporelle en premier. Comme pour la v1, ce sont des expériences de recherche : attendez-vous à des échecs et itérez sur l'invite.

Liens

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
Edit Anything v2 : Édition vidéo multi-instructions pour LTX-2.5 | ComfyUI Wiki