LTX-2.5 : Lightricks lance un modèle vidéo ouvert de 22B
Lightricks publie LTX-2.5, un modèle audio-vidéo de 22B à poids ouverts avec multishot natif, sortie 4K HDR et modèles de flux de travail officiels pour ComfyUI.
Vue d'ensemble
LTX-2.5 est la prochaine génération de la famille de modèles vidéo ouverts de Lightricks, succédant à LTX-2.3. Il est construit sur un transformateur de diffusion asymétrique à double flux de 22 milliards de paramètres qui génère conjointement la vidéo et l'audio grâce à une attention croisée bidirectionnelle avec un guidage sans classifieur sensible à la modalité. L'encodeur de texte est un modèle Gemma 4 12B avec une projection apprise.
Le modèle est disponible à la fois en checkpoint dev complet et en variante distillée en quelques étapes, et prend en charge la génération texte-vers-vidéo, image-vers-vidéo, vidéo-vers-vidéo, texte-vers-audio et audio-vers-vidéo. Lightricks indique qu'un clip de 10 secondes à partir d'une image peut être généré en environ 6 à 8 secondes sur les superpuces NVIDIA avec le modèle distillé.
Démo principale officielle de LTX-2.5 (vidéo de ltx.io)
Nouveautés de LTX-2.5
Multishot natif. Le modèle peut générer des scènes connectées (plans larges, moyens et rapprochés) en une seule génération tout en maintenant la cohérence du personnage, de l'environnement, de l'éclairage et de la voix entre les plans.
Durée automatique. La durée des clips est prédite à partir de l'action décrite, afin que les scènes atteignent naturellement la bonne durée sans réglage manuel du nombre d'images.
4K HDR natif. Le modèle cible une sortie haute résolution et à grande gamme dynamique, avec des pipelines HDR intégrés aux flux de travail officiels.
Diffusion Fidelity Rendering (DFR). Une nouvelle passe de rendu destinée aux séquences réelles, aux résultats éditables et à une sortie EXR de qualité cinéma pour les pipelines de production.
Poids et variantes
Le référentiel Hugging Face fournit l'ensemble complet des poids officiels :
- Base :
ltx-2.5-22b-dev-transformer-bf16.safetensors - Distillé :
ltx-2.5-22b-distilled-transformer-bf16.safetensors - Quantifications prêtes pour ComfyUI : variantes int8 convrot et NVFP4 du transformateur distillé
- Encodeur de texte :
gemma4-12b-with-proj-ltx-2.5(BF16 et int8 convrot ComfyUI) - VAE : VAE vidéo et VAE audio séparés
- Upscalers : upscalers spatiaux latents 2x et upscalers temporels latents 2x
- Modules complémentaires : un LoRA distillé (450) et un correctif de modèle pour la tête de durée
Prise en charge de ComfyUI
LTX-2.5 est pris en charge dans ComfyUI dès le premier jour. Des modèles de flux de travail officiels pour la génération texte-vers-vidéo, image-vers-vidéo et première/dernière image-vers-vidéo sont disponibles dans la bibliothèque de modèles de flux de travail ComfyUI :
Lightricks a également mis à jour son wrapper officiel ComfyUI-LTXVideo avec un ensemble complet d'exemples de flux de travail 2.5, couvrant la T2V/I2V en une ou deux étapes (avec upscaling), l'inpainting et l'outpainting ICLoRA, le suivi de mouvement, le contrôle union et la génération texte-vers-audio.
Liens
- Page du modèle : ltx.io/model
- Poids : Lightricks/LTX-2.5 sur Hugging Face
- Wrapper ComfyUI : Lightricks/ComfyUI-LTXVideo
- Modèles de flux de travail : Comfy-Org/workflow_templates
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.