FreeVideo: 8 GBのVRAMでMiniMax H3を実行

ComfyUI Wikinews

FlashMLのFreeVideoは、8ステップのVDN-H3モデルとFP8実行を基盤とし、ComfyUIプラグインおよびWindowsランチャーとして提供され、わずか8 GBのVRAMでMiniMax H3を実行できます。

FreeVideo は、FlashMLチームによるローカル推論エンジンで、わずか8 GBのVRAMと16 GBのRAMでMiniMax H3の動画と音声を生成します。ComfyUIプラグインとしてインストールでき、ワンクリックのWindowsランチャーとLinux向けのコマンドライン手段を提供し、検出したハードウェアに合わせて実行プランを適応させます。
ComfyUI内で動作するFreeVideoクリエイティブワークスペース

ComfyUI内のFreeVideoワークスペース。LoRAとワークフロー編集用のノードビューも利用できます。

VDN-H3をベースに構築

FreeVideoは、高密度なH3 transformerを実行するのではなく、OpenVDNの8ステップVDN-H3チェックポイントを実行します。これは、H3の二次的な長距離アテンションをリニア分岐に置き換えたVideo DeltaNetハイブリッドアテンションの再設計版です(VDN-H3の解説を参照)。FreeVideoは、そのモデルを用意済みのFP8 vdn-minimax-h3-edgeリリース(フォーマットあたり約22.9 GB)としてパッケージ化し、その上に、実行時にH3の50個のtransformerブロックのそれぞれがどこに配置されるかを決定するプランナーを重ねています。

ハードウェア適応型の実行

各リクエストごとに、Adaptive Execution Plannerは空きVRAM、利用可能なホストメモリ、アテンションカーネルのプローブ結果を測定し、次を決定します:

  • ブロックの常駐:50個のtransformerブロックのうち何個をVRAMに保持し、何個をピン留めされたホストメモリ(最大22 GB)に置き、何個を各ステップでディスクから読み込むか。
  • FP8 GEMMパス:Blackwell(SM120)ではper-tensorスケール、AdaとHopperではper-channelスケール、AmpereではBF16計算によるFP8重み。
  • アテンションバックエンド:SageAttention 2、PyTorch flash attention、cuDNN、FlashAttention 2、FlashAttention 4のうち、オンデバイスプローブに最初に合格したもの。
  • VAEデコーダの配置:20 GBの予算を下回る場合、デコーダの36ブロックの一部を常駐させ、残りをストリーミングし、クリップを順番にデコードします。

予算はリクエストごとに再測定され、完了した実行はタイミングとメモリピークをresource-history.sqlite3に保存します。エンジンはこれを使って、少なくとも2%高速になると予測される配置が存在する場合に、より高速な配置に切り替えます。

VRAM予算別のFreeVideoブロック常駐VRAM予算別のFreeVideo速度
各VRAM予算で50個のtransformerブロックがどこに配置されるか各VRAM予算でプランナーが予測するスループット

実行できるもの

  • テキストプロンプトから音声付き動画を生成
  • 最初と最後のフレームの条件付け
  • 画像、動画、音声の参照
  • 同じワークフロー内のコミュニティMiniMax H3 LoRA
  • ComfyUIワークスペースからの2パスサンプリングとバッチ生成、および過去の作成履歴

はじめに

Windowsでは、windows-previewリリースからFreeVideo.exeをダウンロードして実行します。ランチャーはComfyUI、ランタイム、およびGPUに合ったモデルパックをインストールし、既存のモデルフォルダを再利用し、ダウンロード済みパッケージからのオフラインインストールをサポートします。

既存のComfyUIインストールにFreeVideoを追加するには:

cd ComfyUI/custom_nodes
git clone https://github.com/FlashML-org/FreeVideo.git

ComfyUIを再起動し、ワークフロー -> テンプレートを参照 -> FreeVideo -> FreeVideo-All-in-Oneを開き、FreeVideoの設定でセットアップを完了します。Linuxでは、リポジトリがCLIも提供しています:

git clone https://github.com/FlashML-org/FreeVideo.git && cd FreeVideo
./setup.sh
./freevideo generate --prompt-file prompt.txt --out video.mp4

同梱のサンプルワークフローは、テンプレートブラウザに表示されるものです:

入手方法

FreeVideoはgithub.com/FlashML-org/FreeVideoにあり、用意済みのFP8重みはOpenVDN/vdn-minimax-h3-edgeから提供されます。ランチャーは検出されたアーキテクチャに合わせて自動的にダウンロードします。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
FreeVideo: 8 GBのVRAMでMiniMax H3を実行 | ComfyUI Wiki