LTX-2.5: Lightricks lanza un modelo de vídeo abierto de 22B

ComfyUI Wikinews

Lightricks publica LTX-2.5, un modelo de audio y vídeo de 22B con pesos abiertos, multishot nativo, 4K HDR y plantillas oficiales para ComfyUI.

Lightricks ha lanzado LTX-2.5, un nuevo modelo fundacional de audio y vídeo con pesos abiertos y 22B de parámetros. Introduce escenas multishot nativas, duración automática y salida 4K HDR, con plantillas de flujo de trabajo oficiales de ComfyUI y flujos de trabajo de ejemplo disponibles desde el primer día.

Información general

LTX-2.5 es la próxima generación de la familia de modelos fundacionales de vídeo abiertos de Lightricks, sucesora de LTX-2.3. Está construido sobre un transformer de diffusion asimétrico de doble flujo con 22B de parámetros que genera vídeo y audio de forma conjunta mediante atención cruzada bidireccional con orientación libre de clasificador consciente de la modalidad. El codificador de texto es un modelo Gemma 4 12B con una proyección aprendida.

El modelo se distribuye como un checkpoint de desarrollo completo y como una variante destilada de pocos pasos, y admite generación de texto a vídeo, imagen a vídeo, vídeo a vídeo, texto a audio y audio a vídeo. Lightricks afirma que un clip de 10 segundos a partir de una imagen puede generarse en aproximadamente 6-8 segundos en superchips NVIDIA con el modelo destilado.

Demo principal oficial de LTX-2.5 (vídeo de ltx.io)

Novedades de LTX-2.5

Multishot nativo. El modelo puede generar escenas conectadas (planos generales, medios y primeros planos) en una sola generación, manteniendo la coherencia del personaje, el entorno, la iluminación y la voz entre los cortes.

Multishot nativo

Duración automática. La longitud del clip se predice a partir de la acción descrita, de modo que las escenas alcanzan la duración correcta sin necesidad de ajustar manualmente el número de fotogramas.

Duración automática

4K HDR nativo. El modelo apunta a una salida de alta resolución y alto rango dinámico, con pipelines HDR integrados en los flujos de trabajo oficiales.

4K HDR

Diffusion Fidelity Rendering (DFR). Un nuevo pase de renderizado orientado a metraje real, resultados editables y salida EXR de calidad cinematográfica para pipelines de producción.

Diffusion Fidelity Rendering

Pesos y variantes

El repositorio de Hugging Face proporciona el conjunto completo de pesos oficiales:

  • Base: ltx-2.5-22b-dev-transformer-bf16.safetensors
  • Destilado: ltx-2.5-22b-distilled-transformer-bf16.safetensors
  • Cuantizaciones listas para ComfyUI: variantes int8 convrot y NVFP4 del transformer destilado
  • Codificador de texto: gemma4-12b-with-proj-ltx-2.5 (BF16 e int8 convrot para ComfyUI)
  • VAEs: un VAE de vídeo y un VAE de audio independientes
  • Upscalers: upscalers 2x de latent espacial y 2x de latent temporal
  • Complementos: un LoRA destilado (450) y un parche de modelo con cabeza de duración

Soporte para ComfyUI

LTX-2.5 es compatible con ComfyUI desde el primer día. Las plantillas de flujo de trabajo oficiales para texto a vídeo, imagen a vídeo y primer/último fotograma a vídeo están disponibles en la biblioteca de plantillas de flujo de trabajo de ComfyUI:

Lightricks también actualizó su wrapper oficial ComfyUI-LTXVideo con un conjunto completo de flujos de trabajo de ejemplo de 2.5, que cubren T2V/I2V de una y dos etapas (con upscale), inpainting y outpainting con ICLoRA, seguimiento de movimiento, control de unión y generación de texto a audio.

Enlaces

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
LTX-2.5: Lightricks lanza un modelo de vídeo abierto de 22B | ComfyUI Wiki