Veda Sparse AttentionがComfyUIに登場: MiniMax H3が高速化
Vedaチームが公式ComfyUIノードを公開。蒸留されたスパース予測器でMiniMax H3のアテンションを置き換え、アテンションタイルの90%をスキップして動画生成を最大3倍高速化します。
Vedaプロジェクトページより: 720p、241フレームのWaver-T2V-12B。左がフルアテンション、右がVedaのタイルスキップ経路です。
Vedaの仕組み
モデルを圧縮したり再トレーニングしたりするのではなく、Vedaはアテンションマップのどの部分が重要かを学習します。蒸留された軽量予測器がアテンションタイルをスコアリングして上位およそ10%だけを保持し、タイルスキップカーネルが選択されたK/Vタイルのみを取得します。重み自体ではなくアテンションの計算方法を変更するため、あらゆるLoRAや、ファインチューニング済み・量子化済みのMiniMax H3チェックポイントとの互換性を保ちます。
プロジェクトページでは、この方法を3つの段階で説明しています。マックスプールされたフルアテンションがタイルレベルの教師分布を提供し、ヘッドごとのQ/K射影を備えたTriplet Pooling推定器がその分布を再構成し、ヘッド認識のtop-k選択がカーネルの従うタイルマスクを出力します。レイヤーごと、ヘッドごとのタイル形状は、異種の空間ヘッドと時間ヘッドを固定のハードウェア予算内に収めるように選択されます。
MiniMax H3では、公開された予測器は8ステップのTurbo LoRAでトレーニングされています。リポジトリによれば、このチェックポイントはモダリティとステップ数に依存しません。任意のサンプリングステップ数でT2VA、FL2VA、R2VAに適用でき、専用のR2VAファインチューンが将来のリリースで予告されています。
ComfyUIノード
このノードは意図的に小さく、MODEL入力、MODEL出力です。アテンションオーバーライドとしてインストールされるため、MODELワイヤー上ではモデルとLoRAローダーの後、ガイダーまたはサンプラーの直前に配置します。Ctrl+Bでバイパスすると、同じシードをフルアテンションでレンダリングし、直接比較できます。
| 入力 | デフォルト | 説明 |
|---|---|---|
generated_sparsity | 90% | 生成済み動画のアテンションのスパース率。24 のような整数を指定すると、代わりに128トークンのキータイルを正確にその数だけ保持します。 |
reference_sparsity | 90% | 参照トークンに対する同じ設定: 先頭/末尾フレーム、ガイドフレーム、参照画像、参照動画。0% にするとフルアテンションになります。 |
full_attention_layers | 空 | フルアテンションを維持する0始まりのDiTブロック。例: 0, 1, 47-49。 |
full_attention_steps | 空 | フルアテンションを維持する0始まりのサンプリングステップ。 |
verbose | オフ | 各実行後にフェーズごとのアテンション時間、呼び出し回数、予測器の詳細を報告します。 |
実行後、ノードは実際に何を行ったかを出力します:
Veda done · Triton INT8 (SM120)
Video: 1344x768 · 5.2 s
Attention computed: 10.9% of full attention (89.1% skipped)カーネルが現在のGPUで実行できない場合、ノードはその旨を通知し、壊れたレンダリングを生成する代わりに、その実行ではモデル自身のアテンションにフォールバックします。
パフォーマンス
1344x768、124フレーム(5.2秒)、8ステップのTurbo LoRA、スパース率90%のT2VAを、Windows 11上のRTX 5070 12 GBで計測:
| アテンション経路 | ステップあたり | 8ステップ | ステップあたりのアテンション |
|---|---|---|---|
| ComfyUI デフォルト | 40.7 s | 342 s | 31.1 s |
ComfyUI --use-sage-attention | 24.8 s | 231 s | 15.2 s |
| Veda sparse INT8 | 14.0 s | 130 s | 4.41 s |
これはエンドツーエンドで約2.9倍、アテンション単体で7.1倍に相当し、クリップが長くなるほど差は広がります。104kトークン、スパース率90%の単一アテンションレイヤーは528 msで、フルアテンションの11.8秒と比べてこの値です。
スパース率95%のVeda。Vedaプロジェクトは、720p、241フレームのWaver-T2V-12Bで5.1倍のエンドツーエンド高速化を報告しており、19.4分から3.8分に短縮されます。
予測器のリポジトリでは、自身のフルアテンションをベースラインとしたエンドツーエンドの高速化も示されています。いずれもTurbo LoRAでアテンションを10%保持した場合です:
| GPU | クリップ | アテンションの高速化 | エンドツーエンドの高速化 |
|---|---|---|---|
| RTX PRO 6000 Blackwell | 16:9 · 14.4 s | 6.79x | 3.12x |
| RTX 4090 | 16:9 · 5.17 s | 4.75x | 1.77x |
| RTX 4090 | 16:9 · 10.1 s | 6.22x | 2.42x |
| RTX 4090 | 16:9 · 14.4 s | 6.31x | 2.82x |
左がフルアテンション、右がVeda。同じプロンプト、シード、Turbo LoRAを使用し、単一のRTX PRO 6000 Blackwellで生成しました。
ハードウェアサポート
1つのTritonカーネルが、WindowsとLinux上のSM80以降のすべてのNVIDIA GPUをカバーし、AppleシリコンはMLX経由で動作します。対応するカーネルがないカードではその旨が通知され、モデルは自身のアテンションを維持します。
| ハードウェア | ステータス |
|---|---|
| RTX 30 / A100 / RTX 40 / L40 (sm80-89) | コードパスは準備済み、著者による検証は未実施 |
| H100 / H200 (sm90) | コードパスは準備済み、著者による検証は未実施 |
| B200 / B300 (sm100 / sm103) | コードパスは準備済み、著者による検証は未実施 |
| RTX 50, RTX PRO 6000 Blackwell (sm120) | 検証済み: RTX 5070、Windows 11 |
| DGX Spark / GB10 (sm121) | コードパスは準備済み、著者による検証は未実施 |
| Appleシリコン(Mシリーズ) | 検証済み: M3 Pro、macOS 15 |
はじめに
VedaにはComfyUI 0.38.0以降が必要です。ComfyUIマネージャーで「Veda」を検索してインストールするか、CLIからインストールします:
comfy node install veda-sparse-attention次に275 MBの予測器を ComfyUI/models/veda/ に配置します:
hf download Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview \
minimax_h3_t2va_veda_8nfe_600step_preview_fp8.safetensors \
--local-dir ComfyUI/models/vedaこのノードは自身では何もダウンロードしません。より簡単な方法は、ワークフロー -> テンプレートを参照 -> Veda-on-ComfyUI を開いてテンプレートを選ぶことです。ComfyUIの不足しているモデルのダイアログで予測器が提示されます。リポジトリには2つのサンプルワークフローが同梱されています:
入手方法
このノードはComfy Registryに veda-sparse-attention として公開されており、ソースは veda-sparse/Veda-on-ComfyUI にあります。予測器のチェックポイントは Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview に、トレーニングコードは veda-sparse/Miowtion にあります。公開された予測器はプレビューとしてタグ付けされており、8ステップのTurbo LoRAを使い、5秒、10秒、14秒の1344x768、768x1344、768x768、1024x768向けにトレーニングされています。その他のサイズは最も近いトレーニング済みタイルプランにフォールバックするため、フルアテンションと比較することをお勧めします。
コメント
GitHubでサインインしてディスカッションに参加しましょう。