LTX-2.5: открытая аудио-видео модель 22B с мультишотом и 4K HDR
LTX-2.5: открытая аудио-видео модель от Lightricks на 22B параметров с нативными мультишот-сценами, авто-длительностью и выводом 4K HDR. Поддерживается в ComfyUI с первого дня.
LTX-2.5
VideoAudio-VideoText-to-VideoImage-to-VideoDiTLightricksОткрытая аудио-видео фундаментальная модель от Lightricks на 22B параметров, построенная на асимметричном двухпоточном diffusion-трансформере, который совместно генерирует видео и аудио. Она добавляет нативные мультишот-сцены, авто-длительность, вывод 4K HDR и Diffusion Fidelity Rendering, а также поставляется как полный dev checkpoint и дистиллированный вариант на несколько шагов.
| Разработчик | Lightricks |
| Дата выпуска | 2026-08 (открытые веса) |
| Архитектура | Асимметричный двухпоточный DiT (22B), совместная генерация видео и аудио |
| Текстовый энкодер | Gemma 4 12B с обученной проекцией |
| Лицензия | LTX-2.x Community License |
| Режимы генерации | Текст-в-видео, изображение-в-видео, видео-в-видео, текст-в-аудио, аудио-в-видео |
| Квантованные веса | INT8 convrot, NVFP4 (дистиллированный трансформер) |
Что такое LTX-2.5?
LTX-2.5 является преемником LTX-2.3 в открытом видео-семействе Lightricks. Это асимметричный двухпоточный diffusion-трансформер на 22B параметров, который совместно генерирует видео и аудио через двунаправленное кросс-внимание с classifier-free guidance, учитывающим модальность, и объединяет текстовый энкодер Gemma 4 12B с обученной проекцией.
Релиз поставляется в виде полного dev checkpoint и дистиллированного варианта на несколько шагов, а также охватывает генерацию текст-в-видео, изображение-в-видео, видео-в-видео, текст-в-аудио и аудио-в-видео.
Что нового в LTX-2.5?
- Нативный мультишот. Связанные сцены (общий, средний и крупный план) генерируются за один проход, при этом персонаж, окружение, освещение и голос остаются согласованными между склейками.
- Авто-длительность. Длительность клипа предсказывается исходя из описываемого действия, а не задаётся вручную количеством кадров.
- Нативный 4K HDR. Модель нацелена на вывод в высоком разрешении с высоким динамическим диапазоном, а HDR-пайплайны встроены в официальные рабочие процессы.
- Diffusion Fidelity Rendering (DFR). Этап рендеринга, ориентированный на реальные съёмки, редактируемые результаты и EXR-вывод кинематографического качества для продакшн-пайплайнов.
Веса и варианты
Официальный репозиторий Hugging Face предоставляет полный набор весов: dev-трансформер на 22B, дистиллированный трансформер, готовые для ComfyUI квантования INT8 convrot и NVFP4 дистиллированной сборки, текстовый энкодер Gemma 4 12B (BF16 и INT8 convrot), отдельные VAE для видео и аудио, 2x латентные пространственные и временные апскейлеры, дистиллированный LoRA и патч модели duration-head.
Адаптеры сообщества для LTX-2.5, такие как LoRA-усилители CQ и IC-LoRA Ripple и AInVFX Fluid, собраны в загрузках Model Hub для этой версии.
Поддержка ComfyUI
LTX-2.5 поддерживается в ComfyUI с первого дня: официальные шаблоны рабочих процессов для текст-в-видео и изображение-в-видео доступны во встроенной галерее шаблонов:
Официальная обёртка ComfyUI-LTXVideo содержит соответствующий набор примеров для 2.5, охватывающий одноэтапные и двухэтапные апскейленные T2V/I2V, инпейтинг и аутпейтинг с IC-LoRA, отслеживание движения, union control и текст-в-аудио.
Guides and workflows related to this model series.
Комментарии
Войдите через GitHub, чтобы участвовать в обсуждении.