Edit Anything v2: LTX-2.5 를 위한 다중 지시사항 비디오 편집 및 ComfyUI 워크플로

ComfyUI Wikinews

Edit Anything v2 는 LTX-2.5 에 다중 지시사항 비디오 편집을 제공합니다: rank-128 IC-LoRA 를 통해 한 번의 프롬프트로 교체, 제거, 추가 및 스타일 변경이 가능하며 즉시 사용 가능한 ComfyUI 워크플로가 포함되어 있습니다.

Edit Anything v2 (Hugging Face | Civitai) 는 Alissonerdx 가 출시한 LTX-2.5 (22B dev) 용 rank-128 지시사항 IC-LoRA 입니다. 이전 LTX-2.3 트랙과 달리, 단일 프롬프트에서 여러 편집 작업을 수행합니다: Replace, Remove, Add, Restyle 을 수행하며 참조 이미지가 필요 없고 바로 사용할 수 있는 ComfyUI 워크플로가 제공됩니다.

v2 의 새로운 기능

첫 번째 Edit Anything 릴리스 (6 월, 여기서 다룸) 는 세 가지 별도 트랙으로 LTX-2.3 대상이었습니다: 모션 전송, 참조 없는 멀티태스크 LoRA, 그리고 참조 V2V 빌드입니다. Edit Anything v2 는 깔끔한 재시작입니다:

  • LTX-2.5 기반: LTX-2.5 22B dev 에서 처음부터 훈련되었으며, LTX-2.3 LoRA 의 연속 버전이 아닙니다. 2750 개 정렬된 소스/편집된 비디오 쌍, 랭크 128 / 알파 128, 704×384 해상도, 73 프레임.
  • 하나의 프롬프트로 여러 연산: "보라색 도지 챌린저를 초록색 람보르기니로 교체하고, 폭격이 떨어지는 영화적인 종말 장면을 추가하며, 하늘을 일몰로 스타일링하세요"를 한 번의 패스에서 모두 처리합니다. v1 은 한 번에 하나의 연산만 가능했습니다.
  • 참조 이미지 없음: 가이드로 소스 비디오를 넣고, 텍스트로 지시사항을 넣으면 편집된 비디오가 나옵니다. RoPE 트릭이나 사이드카 모듈, 마스킹 레이어가 없습니다.
  • 프롬프트 인핸서: 자연어로 작성하면 적절한 지시사항 프롬프트로 변환됩니다.

예시

각 클립은 3 패널 비교입니다: 소스 가이드 | 첫 번째 패스 | 두 번째 패스 (업스케일됨).

배경 교체, 댄서 유지

edit_anything: Replace the green indoor background with a sandy beach under a bright sky, where the man dances in dark blue swim trunks and a white beach towel draped over his shoulder, holding a yellow inflatable ring around his waist.

차량 교체 + 피사체 유지

edit_anything: Replace the purple Dodge Challenger in the background with a green Lamborghini Huracan, featuring black five-spoke wheels and a low front splitter. The woman remains fully visible throughout the video, wearing her brown suit as she dances in the foreground.

동시에 두 가지 편집

edit_anything: Replace the woman's dark black hair with vibrant red hair. Add a metallic leather metalworker outfit, including a sleeveless top and pants, worn by her in the center of the frame.

ComfyUI 사용법

Hugging Face 리포지토리에서 workflows/EditAnythingLTX2.5.json 을 로드하거나 BFSnodesLTX Multiple Controls 노드를 손으로 직접 연결할 수 있습니다. 학습과 일치하는 설정:

입력
guide_video소스 비디오
guide_source_id0
guide_layoutoverlap
guide_ref_resize_modematch_target
guide_downscale_factor1

identity_image, mask_video, identity_mask_image 는 연결 해제 상태로 두세요. LoRA 는 이들 없이 훈련되었습니다.

추천 시작값: LoRA 강도 1.0, CFG 3~5, 30 스텝, LightX2V 비활성화. 훈련된 박스는 704×384, 73 프레임입니다. 다른 크기와 길이는 외삽이며 시간적 일관성이 먼저 저하됩니다.

프롬프트 규칙

모든 프롬프트는 트리거 edit_anything: 로 시작하며 각 편집마다 문장 하나가 따릅니다. 모델은 네 개의 동사만 이해합니다 (신뢰도 순): Replace, Add, Remove, Restyle. 중요한 규칙:

  • 지시사항당 10~20 단어; 짧으면 설명이 누락되고 길면 이탈됩니다.
  • Add 당 하나씩 객체; 그룹이나 군중의 경우 기존 영역에 대해 Replace 를 사용하세요.
  • 각 지시사항을 눈에 보이는 것에 고정하세요 ("남자의 왼쪽", "프레임 오른쪽 책상 위").
  • 상태를 묘사하세요, 방식이 아닌: "초록 잔디밭에 서 있다", "우아하게 수영한다"가 아님.
  • Restyle 은 전체 클립이 아닌 영역을 대상으로 합니다; 전체 비디오 느낌을 위해 그 영역을 담당하는 부분에 두세 개의 Restyle 지시사항을 작성하세요.
  • Make it <style>Turn it into <style> 는 작동하지 않습니다: Restyle 을 사용하세요.

제한 사항

편집 어휘는 네 개의 동사로 제한됩니다; 프레임의 아주 작은 부분만 변경하는 편집 (미세 제거) 은 가장 신뢰도가 낮습니다; 참조 이미지 지원이 없습니다 (이미지로 "이 객체를 추가하기"는 해결되지 않았습니다); 그리고 훈련된 박스보다 긴 클립은 시간적 일관성이 먼저 손실됩니다. v1 과 마찬가지로 이는 연구 실험입니다: 실패를 예상하고 프롬프트를 반복 개선하세요.

링크

댓글

GitHub로 로그인하고 토론에 참여하세요.

댓글을 불러오는 중…
Edit Anything v2: LTX-2.5 를 위한 다중 지시사항 비디오 편집 및 ComfyUI 워크플로 | ComfyUI Wiki