LTX-2.5: открытая аудио-видео модель 22B с мультишотом и 4K HDR

ComfyUI Wiki

LTX-2.5: открытая аудио-видео модель от Lightricks на 22B параметров с нативными мультишот-сценами, авто-длительностью и выводом 4K HDR. Поддерживается в ComfyUI с первого дня.

L

LTX-2.5

VideoAudio-VideoText-to-VideoImage-to-VideoDiTLightricks

Открытая аудио-видео фундаментальная модель от Lightricks на 22B параметров, построенная на асимметричном двухпоточном diffusion-трансформере, который совместно генерирует видео и аудио. Она добавляет нативные мультишот-сцены, авто-длительность, вывод 4K HDR и Diffusion Fidelity Rendering, а также поставляется как полный dev checkpoint и дистиллированный вариант на несколько шагов.

РазработчикLightricks
Дата выпуска2026-08 (открытые веса)
АрхитектураАсимметричный двухпоточный DiT (22B), совместная генерация видео и аудио
Текстовый энкодерGemma 4 12B с обученной проекцией
ЛицензияLTX-2.x Community License
Режимы генерацииТекст-в-видео, изображение-в-видео, видео-в-видео, текст-в-аудио, аудио-в-видео
Квантованные весаINT8 convrot, NVFP4 (дистиллированный трансформер)

Что такое LTX-2.5?

LTX-2.5 является преемником LTX-2.3 в открытом видео-семействе Lightricks. Это асимметричный двухпоточный diffusion-трансформер на 22B параметров, который совместно генерирует видео и аудио через двунаправленное кросс-внимание с classifier-free guidance, учитывающим модальность, и объединяет текстовый энкодер Gemma 4 12B с обученной проекцией.

Релиз поставляется в виде полного dev checkpoint и дистиллированного варианта на несколько шагов, а также охватывает генерацию текст-в-видео, изображение-в-видео, видео-в-видео, текст-в-аудио и аудио-в-видео.

Что нового в LTX-2.5?

  • Нативный мультишот. Связанные сцены (общий, средний и крупный план) генерируются за один проход, при этом персонаж, окружение, освещение и голос остаются согласованными между склейками.
  • Авто-длительность. Длительность клипа предсказывается исходя из описываемого действия, а не задаётся вручную количеством кадров.
  • Нативный 4K HDR. Модель нацелена на вывод в высоком разрешении с высоким динамическим диапазоном, а HDR-пайплайны встроены в официальные рабочие процессы.
  • Diffusion Fidelity Rendering (DFR). Этап рендеринга, ориентированный на реальные съёмки, редактируемые результаты и EXR-вывод кинематографического качества для продакшн-пайплайнов.

Веса и варианты

Официальный репозиторий Hugging Face предоставляет полный набор весов: dev-трансформер на 22B, дистиллированный трансформер, готовые для ComfyUI квантования INT8 convrot и NVFP4 дистиллированной сборки, текстовый энкодер Gemma 4 12B (BF16 и INT8 convrot), отдельные VAE для видео и аудио, 2x латентные пространственные и временные апскейлеры, дистиллированный LoRA и патч модели duration-head.

Адаптеры сообщества для LTX-2.5, такие как LoRA-усилители CQ и IC-LoRA Ripple и AInVFX Fluid, собраны в загрузках Model Hub для этой версии.

Поддержка ComfyUI

LTX-2.5 поддерживается в ComfyUI с первого дня: официальные шаблоны рабочих процессов для текст-в-видео и изображение-в-видео доступны во встроенной галерее шаблонов:

Официальная обёртка ComfyUI-LTXVideo содержит соответствующий набор примеров для 2.5, охватывающий одноэтапные и двухэтапные апскейленные T2V/I2V, инпейтинг и аутпейтинг с IC-LoRA, отслеживание движения, union control и текст-в-аудио.

Guides and workflows related to this model series.

No articles found.

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…