Edit Anything v2 : Édition vidéo multi-instructions pour LTX-2.5
Edit Anything v2 apporte l'édition vidéo multi-instructions à LTX-2.5 : Remplacer, Supprimer, Ajouter et Redessiner en une invite via une IC-LoRA rang-128 et un flux ComfyUI.
Ce qui est nouveau dans la v2
La première publication Edit Anything (juin, décrite ici) visait LTX-2.3 avec trois pistes distinctes : transfert de mouvement, un LoRA multitâche sans référence, et une construction V2V de référence. Edit Anything v2 est un redémarrage propre :
- Construit sur LTX-2.5 — entraîné à partir de zéro sur LTX-2.5 22B dev, pas une continuation des LoRAs LTX-2.3. 2750 paires de vidéos source/modifiées alignées, rang 128 / alpha 128, à 704×384, 73 images.
- Plusieurs opérations en une seule invite — « Remplacer le Dodge Challenger violet par une Lamborghini verte, et Ajouter une scène cinématographique apocalyptique avec des bombes qui tombent, et Redessiner le ciel en coucher de soleil » tout en un seul passage. La v1 ne pouvait faire qu'une opération à la fois.
- Pas d'image de référence — la vidéo source entre comme guide, l'instruction entre comme texte, la vidéo modifiée sort. Pas d'astuces RoPE, pas de modules sidecar, pas de masques de perte.
- Améliorateur d'invite — écrivez en langage naturel et il est converti en l'invite d'instruction appropriée.
Exemples
Chaque clip est une comparaison à trois panneaux : guide source | premier passage | deuxième passage (upscaled).
Remplacer l'arrière-plan, garder le danseur
edit_anything: Replace the green indoor background with a sandy beach under a bright sky, where the man dances in dark blue swim trunks and a white beach towel draped over his shoulder, holding a yellow inflatable ring around his waist.Remplacer une voiture + garder le sujet
edit_anything: Replace the purple Dodge Challenger in the background with a green Lamborghini Huracan, featuring black five-spoke wheels and a low front splitter. The woman remains fully visible throughout the video, wearing her brown suit as she dances in the foreground.Deux modifications à la fois
edit_anything: Replace the woman's dark black hair with vibrant red hair. Add a metallic leather metalworker outfit, including a sleeveless top and pants, worn by her in the center of the frame.Utilisation dans ComfyUI
Chargez workflows/EditAnythingLTX2.5.json depuis le dépôt Hugging Face, ou connectez-le à la main avec le nœud BFSnodes LTX Multiple Controls. Paramètres correspondant à l'entraînement :
| Entrée | Valeur |
|---|---|
guide_video | votre vidéo source |
guide_source_id | 0 |
guide_layout | overlap |
guide_ref_resize_mode | match_target |
guide_downscale_factor | 1 |
Laissez identity_image, mask_video et identity_mask_image déconnectés : le LoRA a été entraîné sans aucun d'eux.
Départ suggéré : force du LoRA 1.0, CFG 3–5, 30 étapes, pas de LightX2V. La boîte entraînée est 704×384, 73 images : les autres tailles et durées sont une extrapolation et perdent en cohérence temporelle en premier.
Règles de formulation des invites
Chaque invite commence par le déclencheur edit_anything: suivi d'une phrase par modification. Le modèle comprend seulement quatre verbes (du plus au moins fiable) : Remplacer, Ajouter, Supprimer, Redessiner. Règles importantes :
- 10 à 20 mots par instruction ; plus court perd la description, plus long dérive.
- Un objet par
Ajouter; pour un groupe ou une foule, utilisezRemplacersur une région existante à la place. - Ancrer chaque instruction à quelque chose de visible (« à gauche de l'homme », « sur le bureau du côté droit du cadre »).
- Décrire l'état, pas la manière : « debout dans le champ d'herbe verte », pas « nager gracieusement ».
Restylecible une région, pas le clip entier ; pour un look vidéo complet, écrivez deux ou trois instructions Restyle sur les régions qui le portent.Make it <style>etTurn it into <style>ne fonctionnent pas : utilisezRestyle.
Limitations
Le vocabulaire d'édition est limité aux quatre verbes ; les modifications qui changent très peu de l'image (suppressions subtiles) sont les moins fiables ; il n'y a pas de prise en charge de l'image de référence (« ajouter cet objet » avec une image reste non résolu) ; et les clips plus longs que la boîte entraînée perdent la cohérence temporelle en premier. Comme pour la v1, ce sont des expériences de recherche : attendez-vous à des échecs et itérez sur l'invite.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.