LTX-2.5 : modèle audio-vidéo ouvert 22B avec sortie 4K HDR

ComfyUI Wiki

LTX-2.5 est le modèle audio-vidéo open-weights 22B de Lightricks, avec scènes multishot natives, durée automatique et sortie 4K HDR.

L

LTX-2.5

VidéoAudio-VidéoTexte-vers-VidéoImage-vers-VidéoDiTLightricks

Modèle de fondation audio-vidéo open-weights de 22 milliards de paramètres de Lightricks, bâti sur un transformer de diffusion asymétrique à double flux qui génère vidéo et audio conjointement. Il ajoute des scènes multishot natives, la durée automatique, la sortie 4K HDR et le Diffusion Fidelity Rendering, et se décline en un checkpoint dev complet et une variante distillée à quelques étapes.

DéveloppeurLightricks
Date de sortie2026-08 (poids ouverts)
ArchitectureDiT asymétrique à double flux (22B), génération conjointe vidéo et audio
Encodeur de texteGemma 4 12B avec projection apprise
LicenceLTX-2.x Community License
Modes de générationTexte-vers-vidéo, image-vers-vidéo, vidéo-vers-vidéo, texte-vers-audio, audio-vers-vidéo
Poids quantifiésINT8 convrot, NVFP4 (transformer distillé)

Qu'est-ce que LTX-2.5 ?

LTX-2.5 est le successeur de LTX-2.3 dans la famille de modèles vidéo ouverts de Lightricks. C'est un transformer de diffusion asymétrique à double flux de 22 milliards de paramètres qui génère vidéo et audio conjointement via une attention croisée bidirectionnelle avec un classifier-free guidance sensible aux modalités, et il associe un encodeur de texte Gemma 4 12B à une projection apprise.

Cette sortie se décline en un checkpoint dev complet et une variante distillée à quelques étapes, et couvre la génération texte-vers-vidéo, image-vers-vidéo, vidéo-vers-vidéo, texte-vers-audio et audio-vers-vidéo.

Quoi de neuf dans LTX-2.5 ?

  • Multishot natif. Des scènes connectées, plan large, plan moyen et gros plan, sont générées en une seule passe, tandis que le personnage, l'environnement, l'éclairage et la voix restent cohérents d'un plan à l'autre.
  • Durée automatique. La longueur du clip est prédite à partir de l'action décrite, au lieu d'être fixée à la main par un nombre d'images.
  • 4K HDR natif. Le modèle cible une sortie haute résolution et à grande plage dynamique, avec des pipelines HDR intégrés aux flux de travail officiels.
  • Diffusion Fidelity Rendering (DFR). Une passe de rendu pensée pour les images réelles, des résultats éditables et une sortie EXR de qualité cinéma destinée aux pipelines de production.

Poids et variantes

Le référentiel Hugging Face officiel fournit l'ensemble complet des poids : le transformer dev 22B, le transformer distillé, les quantifications INT8 convrot et NVFP4 prêtes pour ComfyUI de la version distillée, l'encodeur de texte Gemma 4 12B (BF16 et INT8 convrot), des VAE vidéo et audio distincts, des upscalers latents spatiaux et temporels 2x, un LoRA distillé et un correctif de modèle duration-head.

Les adaptateurs communautaires pour LTX-2.5, comme les LoRA CQ enhancer et les IC-LoRA Ripple et AInVFX Fluid, sont regroupés dans les téléchargements du Model Hub pour cette version.

Prise en charge dans ComfyUI

LTX-2.5 est pris en charge dans ComfyUI dès le premier jour, avec des modèles de flux de travail officiels pour le texte-vers-vidéo et l'image-vers-vidéo dans la galerie de modèles intégrée :

Le wrapper officiel ComfyUI-LTXVideo embarque un ensemble d'exemples 2.5 assorti, couvrant le T2V/I2V mono-étape et bi-étape avec upscale, l'inpainting et l'outpainting IC-LoRA, le motion tracking, le contrôle union et le texte-vers-audio.

Guides and workflows related to this model series.

No articles found.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…