LTX-2.5:22B 开放权重音视频模型,原生支持多镜头与 4K HDR

ComfyUI Wiki

LTX-2.5 是 Lightricks 的 22B 开放权重音视频模型,具备原生多镜头场景、自动时长与 4K HDR 输出,ComfyUI 首日即提供支持。

L

LTX-2.5

视频音视频文生视频图生视频DiTLightricks

Lightricks 的 220 亿参数开放权重音视频基础模型,基于非对称双流扩散 transformer 构建,可联合生成视频与音频。它新增了原生多镜头场景、自动时长、4K HDR 输出与 Diffusion Fidelity Rendering,并以完整 dev checkpoint 与蒸馏少步变体两种形式发布。

开发者Lightricks
发布日期2026-08(开放权重)
架构非对称双流 DiT(22B),视频与音频联合生成
文本编码器Gemma 4 12B 配合学习式投影
许可证LTX-2.x 社区许可证
生成模式文生视频、图生视频、视频转视频、文生音频、音频转视频
量化权重INT8 convrot、NVFP4(蒸馏 transformer)

LTX-2.5 是什么?

LTX-2.5 是 Lightricks 开放视频家族中 LTX-2.3 的继任者。它是一个 22B 参数的非对称双流扩散 transformer,通过双向交叉注意力并结合模态感知的无分类器引导来联合生成视频与音频,同时将 Gemma 4 12B 文本编码器与学习式投影相配对。

该版本以完整 dev checkpoint 与蒸馏少步变体两种形式发布,覆盖文生视频、图生视频、视频转视频、文生音频与音频转视频生成。

LTX-2.5 有哪些新特性?

  • 原生多镜头。 连接式场景,包括远景、中景与特写,可在单次生成中完成,同时角色、环境、光照与声音在镜头切换之间保持一致。
  • 自动时长。 片段长度根据所描述的动作预测,而无需手动按帧数设定。
  • 原生 4K HDR。 该模型面向高分辨率、高动态范围输出,官方工作流中已内置 HDR 管线。
  • Diffusion Fidelity Rendering (DFR)。 一次面向真实素材、可编辑结果以及电影级 EXR 输出的渲染处理,适用于制作管线。

权重与变体

官方 Hugging Face 仓库提供完整的权重集:22B dev transformer、蒸馏 transformer、面向 ComfyUI 的蒸馏版本 INT8 convrot 与 NVFP4 量化、Gemma 4 12B 文本编码器(BF16 与 INT8 convrot)、独立的视频与音频 VAE、2x latent 空间与时间 upscaler、一个蒸馏 LoRA,以及一个时长头模型补丁。

LTX-2.5 的社区适配器,例如 CQ enhancer LoRA 以及 Ripple 和 AInVFX Fluid IC-LoRA,均收录在本版本的 Model Hub 下载中。

ComfyUI 支持

LTX-2.5 在 ComfyUI 中首日即获支持,内置模板图库提供了文生视频与图生视频的官方工作流模板:

官方 ComfyUI-LTXVideo 封装包附带了一套与之匹配的 2.5 示例,涵盖单阶段与两阶段放大的 T2V/I2V、IC-LoRA 图像修复与扩图、运动跟踪、union 控制以及文生音频。

Guides and workflows related to this model series.

No articles found.

评论

使用 GitHub 登录后即可参与讨论。

评论加载中…