LTX-2.5: Lightricks выпускает открытую видеомодель 22B

ComfyUI Wikinews

Lightricks выпускает LTX-2.5, аудиовидеомодель с открытыми весами на 22B параметров, с нативным мультишотом, 4K HDR и официальными шаблонами ComfyUI.

Lightricks выпустила LTX-2.5, новую фундаментальную аудиовидеомодель с открытыми весами и 22B параметров. Модель представляет нативные мультишот-сцены, автоматическую длительность и выход 4K HDR, а официальные шаблоны рабочих процессов ComfyUI и примеры рабочих процессов доступны с первого дня.

Обзор

LTX-2.5 представляет собой следующее поколение открытого семейства видеомоделей Lightricks, приходящее на смену LTX-2.3. Модель построена на асимметричном двухпоточном diffusion-трансформере с 22B параметров, который генерирует видео и аудио совместно через двунаправленное перекрестное внимание с модально-зависимым направлением без классификатора. Текстовый энкодер представляет собой модель Gemma 4 12B с обученной проекцией.

Модель доступна как в виде полного dev-чейкпоинта, так и в виде дистиллированного варианта на несколько шагов, и поддерживает генерацию текст-в-видео, изображение-в-видео, видео-в-видео, текст-в-аудио и аудио-в-видео. По заявлению Lightricks, 10-секундный клип из изображения можно сгенерировать примерно за 6-8 секунд на суперчипах NVIDIA с использованием дистиллированной модели.

Официальное демо LTX-2.5 (видео с ltx.io)

Что нового в LTX-2.5

Нативный мультишот. Модель может генерировать связанные сцены (общие, средние и крупные планы) в рамках одной генерации, сохраняя персонажа, окружение, освещение и голос согласованными между кадрами.

Нативный мультишот

Автоматическая длительность. Длина клипа предсказывается на основе описанного действия, поэтому сцены получают нужную длительность без ручной настройки количества кадров.

Автоматическая длительность

Нативный 4K HDR. Модель ориентирована на выход с высоким разрешением и высоким динамическим диапазоном, а HDR-пайплайны встроены в официальные рабочие процессы.

4K HDR

Diffusion Fidelity Rendering (DFR). Новый проход рендеринга, нацеленный на реальные видеоматериалы, редактируемые результаты и кинематографический EXR-выход для производственных пайплайнов.

Diffusion Fidelity Rendering

Веса и варианты

В репозитории на Hugging Face доступен полный набор официальных весов:

  • Базовый: ltx-2.5-22b-dev-transformer-bf16.safetensors
  • Дистиллированный: ltx-2.5-22b-distilled-transformer-bf16.safetensors
  • Готовые для ComfyUI квантования: варианты int8 convrot и NVFP4 дистиллированного трансформера
  • Текстовый энкодер: gemma4-12b-with-proj-ltx-2.5 (BF16 и ComfyUI int8 convrot)
  • VAE: отдельные VAE для видео и аудио
  • Апскейлеры: латентные пространственные и временные апскейлеры с увеличением 2x
  • Дополнения: дистиллированный LoRA (450) и патч модели с головой длительности

Поддержка ComfyUI

LTX-2.5 поддерживается в ComfyUI с первого дня. Официальные шаблоны рабочих процессов для генерации видео из текста, из изображения и по первому и последнему кадрам доступны в библиотеке шаблонов рабочих процессов ComfyUI:

Lightricks также обновила свой официальный враппер ComfyUI-LTXVideo, добавив полный набор примеров рабочих процессов 2.5, охватывающих одноэтапную и двухэтапную (с апскейлом) T2V/I2V, инпейтинг и аутпейтинг ICLoRA, отслеживание движения, union control и генерацию текст-в-аудио.

Ссылки

Комментарии

Войдите через GitHub, чтобы участвовать в обсуждении.

Загрузка комментариев…
LTX-2.5: Lightricks выпускает открытую видеомодель 22B | ComfyUI Wiki