LTX-2.5: modelo abierto de audio y vídeo 22B con 4K HDR
LTX-2.5 es el modelo abierto de audio y vídeo de 22B de Lightricks, con escenas multishot nativas, duración automática y salida 4K HDR.
LTX-2.5
VídeoAudio-VídeoTexto a vídeoImagen a vídeoDiTLightricksModelo fundacional abierto de audio y vídeo de 22B parámetros de Lightricks, construido sobre un transformer de difusión asimétrico de doble flujo que genera vídeo y audio de forma conjunta. Añade escenas multishot nativas, duración automática, salida 4K HDR y Diffusion Fidelity Rendering, y se distribuye tanto como checkpoint dev completo como en una variante destilada de pocos pasos.
| Desarrollador | Lightricks |
| Fecha de lanzamiento | 2026-08 (pesos abiertos) |
| Arquitectura | DiT asimétrico de doble flujo (22B), generación conjunta de vídeo y audio |
| Codificador de texto | Gemma 4 12B con proyección aprendida |
| Licencia | Licencia comunitaria LTX-2.x |
| Modos de generación | Texto a vídeo, imagen a vídeo, vídeo a vídeo, texto a audio, audio a vídeo |
| Pesos cuantizados | INT8 convrot, NVFP4 (transformer destilado) |
¿Qué es LTX-2.5?
LTX-2.5 es el sucesor de LTX-2.3 en la familia de vídeo abierto de Lightricks. Es un transformer de difusión asimétrico de doble flujo de 22B parámetros que genera vídeo y audio de forma conjunta mediante atención cruzada bidireccional con orientación libre de clasificador consciente de la modalidad, y combina un codificador de texto Gemma 4 12B con una proyección aprendida.
El lanzamiento se distribuye como un checkpoint dev completo y una variante destilada de pocos pasos, y cubre la generación de texto a vídeo, imagen a vídeo, vídeo a vídeo, texto a audio y audio a vídeo.
¿Qué hay de nuevo en LTX-2.5?
- Multishot nativo. Las escenas conectadas, plano general, medio y primer plano, se generan en una sola pasada mientras el personaje, el entorno, la iluminación y la voz se mantienen consistentes entre los cortes.
- Duración automática. La longitud del clip se predice a partir de la acción descrita, en lugar de establecerse a mano como un número de fotogramas.
- 4K HDR nativo. El modelo apunta a una salida de alta resolución y alto rango dinámico, con pipelines HDR integrados en los flujos de trabajo oficiales.
- Diffusion Fidelity Rendering (DFR). Una pasada de renderizado orientada a metraje real, resultados editables y salida EXR de calidad cinematográfica para pipelines de producción.
Pesos y variantes
El repositorio oficial de Hugging Face proporciona el conjunto completo de pesos: el transformer dev de 22B, el transformer destilado, las cuantizaciones INT8 convrot y NVFP4 listas para ComfyUI de la versión destilada, el codificador de texto Gemma 4 12B (BF16 e INT8 convrot), VAE de vídeo y audio separados, upscalers latentes espaciales y temporales 2x, un LoRA destilado y un parche de modelo con cabeza de duración.
Los adaptadores de la comunidad para LTX-2.5, como los LoRA de mejora CQ y los IC-LoRA Ripple y AInVFX Fluid, se recopilan en las descargas del Model Hub para esta versión.
Soporte en ComfyUI
LTX-2.5 cuenta con soporte en ComfyUI desde el primer día, con plantillas de flujos de trabajo oficiales para texto a vídeo e imagen a vídeo en la galería de plantillas integrada:
El wrapper oficial ComfyUI-LTXVideo incluye un conjunto de ejemplos 2.5 a juego que abarca T2V/I2V con upscale de una y dos etapas, relleno inteligente y outpainting con IC-LoRA, seguimiento de movimiento, control union y texto a audio.
Guides and workflows related to this model series.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.