LTX-2.5: ネイティブマルチショットと4K HDRに対応した22Bのオープン音声動画モデル

ComfyUI Wiki

LTX-2.5は、ネイティブなマルチショットシーン、自動再生時間、4K HDR出力を備えたLightricksの22Bオープンウェイト音声動画モデルで、初日からComfyUIでサポートされています。

L

LTX-2.5

VideoAudio-VideoText-to-VideoImage-to-VideoDiTLightricks

Lightricksによる22Bパラメータのオープンウェイト音声動画基盤モデル。動画と音声を同時に生成する非対称デュアルストリーム拡散Transformerをベースにしています。ネイティブなマルチショットシーン、自動再生時間、4K HDR出力、Diffusion Fidelity Renderingを追加し、フルのdevチェックポイントと蒸留済みの少数ステップ版の両方として提供されます。

開発元Lightricks
リリース日2026-08(オープンウェイト)
アーキテクチャ非対称デュアルストリームDiT(22B)、動画と音声の同時生成
テキストエンコーダーGemma 4 12B(学習済みプロジェクション付き)
ライセンスLTX-2.x Community License
生成モードテキストから動画へ、画像から動画へ、動画から動画へ、テキストから音声生成、音声から動画へ
量子化ウェイトINT8 convrot、NVFP4(蒸留Transformer)

LTX-2.5とは?

LTX-2.5は、Lightricksのオープン動画ファミリーにおけるLTX-2.3の後継モデルです。220億パラメータの非対称デュアルストリーム拡散Transformerであり、モダリティ認識型のclassifier-freeガイダンスを伴う双方向クロスアテンションを通じて動画と音声を同時に生成し、Gemma 4 12Bテキストエンコーダーを学習済みプロジェクションと組み合わせています。

このリリースはフルのdevチェックポイントと蒸留済みの少数ステップ版として提供され、テキストから動画へ、画像から動画へ、動画から動画へ、テキストから音声生成、音声から動画への生成をカバーします。

LTX-2.5の新機能

  • ネイティブなマルチショット。 接続されたシーン(ワイド、ミディアム、クローズアップ)を1回のパスで生成し、カットをまたいでもキャラクター、環境、ライティング、声が一貫します。
  • 自動再生時間。 クリップの長さは、フレーム数として手動で設定するのではなく、記述されたアクションから予測されます。
  • ネイティブ4K HDR。 このモデルは高解像度・ハイダイナミックレンジの出力を目標としており、公式ワークフローにはHDRパイプラインが組み込まれています。
  • Diffusion Fidelity Rendering(DFR)。 実写映像、編集可能な結果、制作パイプライン向けのシネマグレードEXR出力を目的としたレンダリングパスです。

ウェイトとバリアント

公式のHugging Faceリポジトリは完全なウェイトセットを提供しています。22Bのdev Transformer、蒸留Transformer、蒸留ビルドのComfyUI対応INT8 convrotおよびNVFP4量子化、Gemma 4 12Bテキストエンコーダー(BF16およびINT8 convrot)、動画用と音声用に分かれたVAE、2倍の潜在空間・時間アップスケーラー、蒸留LoRA、duration-headモデルパッチです。

LTX-2.5向けのコミュニティ製アダプター(CQ enhancer LoRA、RippleやAInVFX FluidのIC-LoRAなど)は、このバージョンのModel Hubダウンロードでキュレーションされています。

ComfyUIサポート

LTX-2.5は初日からComfyUIでサポートされており、組み込みのテンプレートギャラリーにテキストから動画へ、画像から動画への公式ワークフローテンプレートが用意されています。

公式のComfyUI-LTXVideoラッパーには、シングルステージおよび2ステージのアップスケールT2V/I2V、IC-LoRAインペイントとアウトペイント、モーショントラッキング、union control、テキストから音声生成をカバーする2.5対応のサンプルセットが含まれています。

Guides and workflows related to this model series.

No articles found.

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…