LTX-2.5:Lightricks 为 ComfyUI 发布 22B 开源视频模型
Lightricks 发布 LTX-2.5,一款 22B 开源权重音视频基础模型,支持原生多镜头、4K HDR,并提供官方 ComfyUI 工作流模板。
概述
LTX-2.5 是 Lightricks 开源视频基础模型家族的新一代产品,接替 LTX-2.3。它基于 22B 参数的非对称双流 diffusion Transformer 构建,通过双向交叉注意力和模态感知的无分类器引导(classifier-free guidance),联合生成视频和音频。文本编码器采用带可学习投影的 Gemma 4 12B 模型。
该模型同时提供完整的开发专用(dev)checkpoint 和蒸馏式少步数变体,支持文生视频、图生视频、视频转视频、文生音频和音频生视频。Lightricks 表示,使用蒸馏模型在 NVIDIA 超级芯片上生成一段 10 秒片段大约需要 6-8 秒。
LTX-2.5 官方演示视频(视频来源:ltx.io)
LTX-2.5 的新特性
原生多镜头。 该模型可在单次生成中输出连接式场景,包括全景、中景和特写镜头,并在不同镜头之间保持角色、环境、灯光和声音的一致性。
自动时长。 片段长度会根据所描述的动作自动预测,因此场景能够落在正确的时长上,无需手动调整帧数。
原生 4K HDR。 该模型面向高分辨率、高动态范围输出,官方工作流中内置了 HDR pipeline。
Diffusion Fidelity Rendering(DFR)。 一种全新的渲染通道,专为实拍素材、可编辑结果和面向制作 pipeline 的电影级 EXR 输出而设计。
权重与变体
Hugging Face 仓库 提供了完整的官方权重集合:
- 基础版(Base):
ltx-2.5-22b-dev-transformer-bf16.safetensors - 蒸馏版(Distilled):
ltx-2.5-22b-distilled-transformer-bf16.safetensors - ComfyUI 即用型量化版本:蒸馏 Transformer 的 int8 convrot 和 NVFP4 变体
- 文本编码器:
gemma4-12b-with-proj-ltx-2.5(BF16 和 ComfyUI int8 convrot) - VAE:独立的视频 VAE 和音频 VAE
- Upscaler:Latent 空间 2 倍 Upscaler 和 Latent 时间 2 倍 Upscaler
- 附加组件:蒸馏 LoRA(450)和时长头(duration-head)模型补丁
ComfyUI 支持
LTX-2.5 在发布首日即获得 ComfyUI 支持。文生视频、图生视频和首帧/末帧生视频的官方工作流模板已可在 ComfyUI 工作流模板库中获取:
Lightricks 还更新了其官方 ComfyUI-LTXVideo 封装,提供完整的 2.5 示例工作流 集合,涵盖单阶段和两阶段(放大)T2V/I2V、ICLoRA 图像修复(inpainting)与外绘(outpainting)、运动跟踪、Union 控制以及文生音频生成。
链接
- 模型页面:ltx.io/model
- 权重:Lightricks/LTX-2.5(Hugging Face)
- ComfyUI 封装:Lightricks/ComfyUI-LTXVideo
- 工作流模板:Comfy-Org/workflow_templates
评论
使用 GitHub 登录后即可参与讨论。