LTX-2.5 : Lightricks lance un modèle vidéo ouvert de 22B

ComfyUI Wikinews

Lightricks publie LTX-2.5, un modèle audio-vidéo de 22B à poids ouverts avec multishot natif, sortie 4K HDR et modèles de flux de travail officiels pour ComfyUI.

Lightricks a publié LTX-2.5, un nouveau modèle de fondation audio-vidéo de 22 milliards de paramètres à poids ouverts. Il introduit des scènes multishot natives, la durée automatique et une sortie 4K HDR, avec des modèles de flux de travail officiels ComfyUI et des exemples de flux de travail disponibles dès le premier jour.

Vue d'ensemble

LTX-2.5 est la prochaine génération de la famille de modèles vidéo ouverts de Lightricks, succédant à LTX-2.3. Il est construit sur un transformateur de diffusion asymétrique à double flux de 22 milliards de paramètres qui génère conjointement la vidéo et l'audio grâce à une attention croisée bidirectionnelle avec un guidage sans classifieur sensible à la modalité. L'encodeur de texte est un modèle Gemma 4 12B avec une projection apprise.

Le modèle est disponible à la fois en checkpoint dev complet et en variante distillée en quelques étapes, et prend en charge la génération texte-vers-vidéo, image-vers-vidéo, vidéo-vers-vidéo, texte-vers-audio et audio-vers-vidéo. Lightricks indique qu'un clip de 10 secondes à partir d'une image peut être généré en environ 6 à 8 secondes sur les superpuces NVIDIA avec le modèle distillé.

Démo principale officielle de LTX-2.5 (vidéo de ltx.io)

Nouveautés de LTX-2.5

Multishot natif. Le modèle peut générer des scènes connectées (plans larges, moyens et rapprochés) en une seule génération tout en maintenant la cohérence du personnage, de l'environnement, de l'éclairage et de la voix entre les plans.

Multishot natif

Durée automatique. La durée des clips est prédite à partir de l'action décrite, afin que les scènes atteignent naturellement la bonne durée sans réglage manuel du nombre d'images.

Durée automatique

4K HDR natif. Le modèle cible une sortie haute résolution et à grande gamme dynamique, avec des pipelines HDR intégrés aux flux de travail officiels.

4K HDR

Diffusion Fidelity Rendering (DFR). Une nouvelle passe de rendu destinée aux séquences réelles, aux résultats éditables et à une sortie EXR de qualité cinéma pour les pipelines de production.

Diffusion Fidelity Rendering

Poids et variantes

Le référentiel Hugging Face fournit l'ensemble complet des poids officiels :

  • Base : ltx-2.5-22b-dev-transformer-bf16.safetensors
  • Distillé : ltx-2.5-22b-distilled-transformer-bf16.safetensors
  • Quantifications prêtes pour ComfyUI : variantes int8 convrot et NVFP4 du transformateur distillé
  • Encodeur de texte : gemma4-12b-with-proj-ltx-2.5 (BF16 et int8 convrot ComfyUI)
  • VAE : VAE vidéo et VAE audio séparés
  • Upscalers : upscalers spatiaux latents 2x et upscalers temporels latents 2x
  • Modules complémentaires : un LoRA distillé (450) et un correctif de modèle pour la tête de durée

Prise en charge de ComfyUI

LTX-2.5 est pris en charge dans ComfyUI dès le premier jour. Des modèles de flux de travail officiels pour la génération texte-vers-vidéo, image-vers-vidéo et première/dernière image-vers-vidéo sont disponibles dans la bibliothèque de modèles de flux de travail ComfyUI :

Lightricks a également mis à jour son wrapper officiel ComfyUI-LTXVideo avec un ensemble complet d'exemples de flux de travail 2.5, couvrant la T2V/I2V en une ou deux étapes (avec upscaling), l'inpainting et l'outpainting ICLoRA, le suivi de mouvement, le contrôle union et la génération texte-vers-audio.

Liens

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
LTX-2.5 : Lightricks lance un modèle vidéo ouvert de 22B | ComfyUI Wiki