LTX-2.5: Lightricks, ComfyUI용 22B 오픈 비디오 모델 출시
Lightricks가 네이티브 멀티샷, 4K HDR, 공식 ComfyUI 워크플로 템플릿을 갖춘 22B 오픈 가중치 오디오-비디오 기반 모델 LTX-2.5를 출시했습니다.
개요
LTX-2.5는 LTX-2.3의 뒤를 잇는 Lightricks 오픈 비디오 기반 모델 패밀리의 차세대 모델입니다. 22B 파라미터 비대칭 듀얼 스트림 diffusion transformer를 기반으로 하며, 양방향 크로스 어텐션과 모달리티 인식 classifier-free guidance를 통해 비디오와 오디오를 함께 생성합니다. 텍스트 인코더는 학습된 프로젝션을 갖춘 Gemma 4 12B 모델입니다.
이 모델은 전체 개발 전용 checkpoint와 distilled few-step 변형으로 제공되며, 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 비디오 기반 비디오 생성, 텍스트 기반 오디오 생성, 오디오 기반 비디오 생성을 지원합니다. Lightricks에 따르면 distilled 모델을 사용하면 NVIDIA 슈퍼칩에서 이미지로부터 10초 클립을 약 6~8초 만에 생성할 수 있습니다.
LTX-2.5 공식 히어로 데모 (ltx.io의 비디오)
LTX-2.5의 새로운 기능
네이티브 멀티샷. 이 모델은 단일 생성으로 연결된 장면(와이드, 미디엄, 클로즈업 샷)을 생성하면서 컷 전반에 걸쳐 캐릭터, 환경, 조명, 음성의 일관성을 유지합니다.
자동 재생 시간. 클립 길이는 설명된 동작에서 예측되므로 수동으로 프레임 수를 조정하지 않아도 장면이 적절한 재생 시간에 맞춰집니다.
네이티브 4K HDR. 이 모델은 고해상도, 고다이내믹 레인지 출력을 목표로 하며, 공식 워크플로에 HDR 파이프라인이 내장되어 있습니다.
Diffusion Fidelity Rendering (DFR). 실제 푸티지, 편집 가능한 결과물, 프로덕션 파이프라인용 시네마급 EXR 출력을 겨냥한 새로운 렌더링 패스입니다.
가중치 및 변형
Hugging Face 저장소에서 공식 가중치 전체 세트를 제공합니다:
- 기본(Base):
ltx-2.5-22b-dev-transformer-bf16.safetensors - Distilled:
ltx-2.5-22b-distilled-transformer-bf16.safetensors - ComfyUI 호환 양자화: distilled transformer의 int8 convrot 및 NVFP4 변형
- 텍스트 인코더:
gemma4-12b-with-proj-ltx-2.5(BF16 및 ComfyUI int8 convrot) - VAE: 비디오 VAE와 오디오 VAE 분리
- 업스케일러: 2x 잠재 데이터 공간(spatial) 업스케일러 및 2x 잠재 데이터 시간(temporal) 업스케일러
- 애드온: distilled LoRA(450) 및 재생 시간 헤드 모델 패치
ComfyUI 지원
LTX-2.5는 출시 첫날부터 ComfyUI에서 지원됩니다. 텍스트 기반 비디오 생성, 이미지 기반 비디오 생성, 첫 번째/마지막 프레임 기반 비디오 생성을 위한 공식 워크플로 템플릿이 ComfyUI 워크플로 템플릿 라이브러리에서 제공됩니다:
Lightricks는 또한 공식 ComfyUI-LTXVideo 래퍼를 전체 2.5 예제 워크플로 세트로 업데이트했습니다. 단일 단계 및 2단계(업스케일) T2V/I2V, ICLoRA 인페인팅 및 아웃페인팅, 모션 트래킹, 유니온 컨트롤, 텍스트 기반 오디오 생성이 포함됩니다.
링크
- 모델 페이지: ltx.io/model
- 가중치: Hugging Face의 Lightricks/LTX-2.5
- ComfyUI 래퍼: Lightricks/ComfyUI-LTXVideo
- 워크플로 템플릿: Comfy-Org/workflow_templates
댓글
GitHub로 로그인하고 토론에 참여하세요.