Edit Anything v2: LTX-2.5 를 위한 다중 지시사항 비디오 편집 및 ComfyUI 워크플로
Edit Anything v2 는 LTX-2.5 에 다중 지시사항 비디오 편집을 제공합니다: rank-128 IC-LoRA 를 통해 한 번의 프롬프트로 교체, 제거, 추가 및 스타일 변경이 가능하며 즉시 사용 가능한 ComfyUI 워크플로가 포함되어 있습니다.
v2 의 새로운 기능
첫 번째 Edit Anything 릴리스 (6 월, 여기서 다룸) 는 세 가지 별도 트랙으로 LTX-2.3 대상이었습니다: 모션 전송, 참조 없는 멀티태스크 LoRA, 그리고 참조 V2V 빌드입니다. Edit Anything v2 는 깔끔한 재시작입니다:
- LTX-2.5 기반: LTX-2.5 22B dev 에서 처음부터 훈련되었으며, LTX-2.3 LoRA 의 연속 버전이 아닙니다. 2750 개 정렬된 소스/편집된 비디오 쌍, 랭크 128 / 알파 128, 704×384 해상도, 73 프레임.
- 하나의 프롬프트로 여러 연산: "보라색 도지 챌린저를 초록색 람보르기니로 교체하고, 폭격이 떨어지는 영화적인 종말 장면을 추가하며, 하늘을 일몰로 스타일링하세요"를 한 번의 패스에서 모두 처리합니다. v1 은 한 번에 하나의 연산만 가능했습니다.
- 참조 이미지 없음: 가이드로 소스 비디오를 넣고, 텍스트로 지시사항을 넣으면 편집된 비디오가 나옵니다. RoPE 트릭이나 사이드카 모듈, 마스킹 레이어가 없습니다.
- 프롬프트 인핸서: 자연어로 작성하면 적절한 지시사항 프롬프트로 변환됩니다.
예시
각 클립은 3 패널 비교입니다: 소스 가이드 | 첫 번째 패스 | 두 번째 패스 (업스케일됨).
배경 교체, 댄서 유지
edit_anything: Replace the green indoor background with a sandy beach under a bright sky, where the man dances in dark blue swim trunks and a white beach towel draped over his shoulder, holding a yellow inflatable ring around his waist.차량 교체 + 피사체 유지
edit_anything: Replace the purple Dodge Challenger in the background with a green Lamborghini Huracan, featuring black five-spoke wheels and a low front splitter. The woman remains fully visible throughout the video, wearing her brown suit as she dances in the foreground.동시에 두 가지 편집
edit_anything: Replace the woman's dark black hair with vibrant red hair. Add a metallic leather metalworker outfit, including a sleeveless top and pants, worn by her in the center of the frame.ComfyUI 사용법
Hugging Face 리포지토리에서 workflows/EditAnythingLTX2.5.json 을 로드하거나 BFSnodes 의 LTX Multiple Controls 노드를 손으로 직접 연결할 수 있습니다. 학습과 일치하는 설정:
| 입력 | 값 |
|---|---|
guide_video | 소스 비디오 |
guide_source_id | 0 |
guide_layout | overlap |
guide_ref_resize_mode | match_target |
guide_downscale_factor | 1 |
identity_image, mask_video, identity_mask_image 는 연결 해제 상태로 두세요. LoRA 는 이들 없이 훈련되었습니다.
추천 시작값: LoRA 강도 1.0, CFG 3~5, 30 스텝, LightX2V 비활성화. 훈련된 박스는 704×384, 73 프레임입니다. 다른 크기와 길이는 외삽이며 시간적 일관성이 먼저 저하됩니다.
프롬프트 규칙
모든 프롬프트는 트리거 edit_anything: 로 시작하며 각 편집마다 문장 하나가 따릅니다. 모델은 네 개의 동사만 이해합니다 (신뢰도 순): Replace, Add, Remove, Restyle. 중요한 규칙:
- 지시사항당 10~20 단어; 짧으면 설명이 누락되고 길면 이탈됩니다.
Add당 하나씩 객체; 그룹이나 군중의 경우 기존 영역에 대해Replace를 사용하세요.- 각 지시사항을 눈에 보이는 것에 고정하세요 ("남자의 왼쪽", "프레임 오른쪽 책상 위").
- 상태를 묘사하세요, 방식이 아닌: "초록 잔디밭에 서 있다", "우아하게 수영한다"가 아님.
Restyle은 전체 클립이 아닌 영역을 대상으로 합니다; 전체 비디오 느낌을 위해 그 영역을 담당하는 부분에 두세 개의 Restyle 지시사항을 작성하세요.Make it <style>와Turn it into <style>는 작동하지 않습니다:Restyle을 사용하세요.
제한 사항
편집 어휘는 네 개의 동사로 제한됩니다; 프레임의 아주 작은 부분만 변경하는 편집 (미세 제거) 은 가장 신뢰도가 낮습니다; 참조 이미지 지원이 없습니다 (이미지로 "이 객체를 추가하기"는 해결되지 않았습니다); 그리고 훈련된 박스보다 긴 클립은 시간적 일관성이 먼저 손실됩니다. v1 과 마찬가지로 이는 연구 실험입니다: 실패를 예상하고 프롬프트를 반복 개선하세요.
댓글
GitHub로 로그인하고 토론에 참여하세요.