LTX-2.5: Lightricks lanza un modelo de vídeo abierto de 22B
Lightricks publica LTX-2.5, un modelo de audio y vídeo de 22B con pesos abiertos, multishot nativo, 4K HDR y plantillas oficiales para ComfyUI.
Información general
LTX-2.5 es la próxima generación de la familia de modelos fundacionales de vídeo abiertos de Lightricks, sucesora de LTX-2.3. Está construido sobre un transformer de diffusion asimétrico de doble flujo con 22B de parámetros que genera vídeo y audio de forma conjunta mediante atención cruzada bidireccional con orientación libre de clasificador consciente de la modalidad. El codificador de texto es un modelo Gemma 4 12B con una proyección aprendida.
El modelo se distribuye como un checkpoint de desarrollo completo y como una variante destilada de pocos pasos, y admite generación de texto a vídeo, imagen a vídeo, vídeo a vídeo, texto a audio y audio a vídeo. Lightricks afirma que un clip de 10 segundos a partir de una imagen puede generarse en aproximadamente 6-8 segundos en superchips NVIDIA con el modelo destilado.
Demo principal oficial de LTX-2.5 (vídeo de ltx.io)
Novedades de LTX-2.5
Multishot nativo. El modelo puede generar escenas conectadas (planos generales, medios y primeros planos) en una sola generación, manteniendo la coherencia del personaje, el entorno, la iluminación y la voz entre los cortes.
Duración automática. La longitud del clip se predice a partir de la acción descrita, de modo que las escenas alcanzan la duración correcta sin necesidad de ajustar manualmente el número de fotogramas.
4K HDR nativo. El modelo apunta a una salida de alta resolución y alto rango dinámico, con pipelines HDR integrados en los flujos de trabajo oficiales.
Diffusion Fidelity Rendering (DFR). Un nuevo pase de renderizado orientado a metraje real, resultados editables y salida EXR de calidad cinematográfica para pipelines de producción.
Pesos y variantes
El repositorio de Hugging Face proporciona el conjunto completo de pesos oficiales:
- Base:
ltx-2.5-22b-dev-transformer-bf16.safetensors - Destilado:
ltx-2.5-22b-distilled-transformer-bf16.safetensors - Cuantizaciones listas para ComfyUI: variantes int8 convrot y NVFP4 del transformer destilado
- Codificador de texto:
gemma4-12b-with-proj-ltx-2.5(BF16 e int8 convrot para ComfyUI) - VAEs: un VAE de vídeo y un VAE de audio independientes
- Upscalers: upscalers 2x de latent espacial y 2x de latent temporal
- Complementos: un LoRA destilado (450) y un parche de modelo con cabeza de duración
Soporte para ComfyUI
LTX-2.5 es compatible con ComfyUI desde el primer día. Las plantillas de flujo de trabajo oficiales para texto a vídeo, imagen a vídeo y primer/último fotograma a vídeo están disponibles en la biblioteca de plantillas de flujo de trabajo de ComfyUI:
Lightricks también actualizó su wrapper oficial ComfyUI-LTXVideo con un conjunto completo de flujos de trabajo de ejemplo de 2.5, que cubren T2V/I2V de una y dos etapas (con upscale), inpainting y outpainting con ICLoRA, seguimiento de movimiento, control de unión y generación de texto a audio.
Enlaces
- Página del modelo: ltx.io/model
- Pesos: Lightricks/LTX-2.5 en Hugging Face
- Wrapper de ComfyUI: Lightricks/ComfyUI-LTXVideo
- Plantillas de flujo de trabajo: Comfy-Org/workflow_templates
Comentarios
Inicia sesión con GitHub para unirte a la conversación.