Veda Sparse AttentionがComfyUIに登場: MiniMax H3が高速化

ComfyUI Wikinews

Vedaチームが公式ComfyUIノードを公開。蒸留されたスパース予測器でMiniMax H3のアテンションを置き換え、アテンションタイルの90%をスキップして動画生成を最大3倍高速化します。

<strong>Veda</strong> は、ByteDance、HKU、USTCによる動画diffusionモデル向けの学習型スパースアテンション手法で、ICML 2026で発表されました。その著者らが公式のComfyUIカスタムノード <strong>Veda Sparse Attention (MiniMax H3)</strong> としてパッケージ化しました。これはモデルの重みを一切変更せずに、MiniMax H3のアテンションを通常の約10分の1のコストで実行します。
同じWaver-T2V-12Bクリップにおける、FlashAttention-3のフルアテンションとスパース率95%のVedaの比較

Vedaプロジェクトページより: 720p、241フレームのWaver-T2V-12B。左がフルアテンション、右がVedaのタイルスキップ経路です。

Vedaの仕組み

モデルを圧縮したり再トレーニングしたりするのではなく、Vedaはアテンションマップのどの部分が重要かを学習します。蒸留された軽量予測器がアテンションタイルをスコアリングして上位およそ10%だけを保持し、タイルスキップカーネルが選択されたK/Vタイルのみを取得します。重み自体ではなくアテンションの計算方法を変更するため、あらゆるLoRAや、ファインチューニング済み・量子化済みのMiniMax H3チェックポイントとの互換性を保ちます。

プロジェクトページでは、この方法を3つの段階で説明しています。マックスプールされたフルアテンションがタイルレベルの教師分布を提供し、ヘッドごとのQ/K射影を備えたTriplet Pooling推定器がその分布を再構成し、ヘッド認識のtop-k選択がカーネルの従うタイルマスクを出力します。レイヤーごと、ヘッドごとのタイル形状は、異種の空間ヘッドと時間ヘッドを固定のハードウェア予算内に収めるように選択されます。

MiniMax H3では、公開された予測器は8ステップのTurbo LoRAでトレーニングされています。リポジトリによれば、このチェックポイントはモダリティとステップ数に依存しません。任意のサンプリングステップ数でT2VA、FL2VA、R2VAに適用でき、専用のR2VAファインチューンが将来のリリースで予告されています。

ComfyUIノード

このノードは意図的に小さく、MODEL入力、MODEL出力です。アテンションオーバーライドとしてインストールされるため、MODELワイヤー上ではモデルとLoRAローダーの後、ガイダーまたはサンプラーの直前に配置します。Ctrl+Bでバイパスすると、同じシードをフルアテンションでレンダリングし、直接比較できます。

入力デフォルト説明
generated_sparsity90%生成済み動画のアテンションのスパース率。24 のような整数を指定すると、代わりに128トークンのキータイルを正確にその数だけ保持します。
reference_sparsity90%参照トークンに対する同じ設定: 先頭/末尾フレーム、ガイドフレーム、参照画像、参照動画。0% にするとフルアテンションになります。
full_attention_layers空フルアテンションを維持する0始まりのDiTブロック。例: 0, 1, 47-49。
full_attention_steps空フルアテンションを維持する0始まりのサンプリングステップ。
verboseオフ各実行後にフェーズごとのアテンション時間、呼び出し回数、予測器の詳細を報告します。

実行後、ノードは実際に何を行ったかを出力します:

Veda done · Triton INT8 (SM120)
Video: 1344x768 · 5.2 s
Attention computed: 10.9% of full attention (89.1% skipped)

カーネルが現在のGPUで実行できない場合、ノードはその旨を通知し、壊れたレンダリングを生成する代わりに、その実行ではモデル自身のアテンションにフォールバックします。

H3では、このノードをComfyUI標準の Model Sparse Attention と併用しないでください。そのノードはアテンションブロックを完全に置き換えるため、Vedaは決して呼び出されません。Vedaノードはこの組み合わせを検出して警告します。

パフォーマンス

1344x768、124フレーム(5.2秒)、8ステップのTurbo LoRA、スパース率90%のT2VAを、Windows 11上のRTX 5070 12 GBで計測:

アテンション経路ステップあたり8ステップステップあたりのアテンション
ComfyUI デフォルト40.7 s342 s31.1 s
ComfyUI --use-sage-attention24.8 s231 s15.2 s
Veda sparse INT814.0 s130 s4.41 s

これはエンドツーエンドで約2.9倍、アテンション単体で7.1倍に相当し、クリップが長くなるほど差は広がります。104kトークン、スパース率90%の単一アテンションレイヤーは528 msで、フルアテンションの11.8秒と比べてこの値です。

同じクリップにおける、スパース率95%のVedaとFlashAttention-3ベースラインの比較

スパース率95%のVeda。Vedaプロジェクトは、720p、241フレームのWaver-T2V-12Bで5.1倍のエンドツーエンド高速化を報告しており、19.4分から3.8分に短縮されます。

予測器のリポジトリでは、自身のフルアテンションをベースラインとしたエンドツーエンドの高速化も示されています。いずれもTurbo LoRAでアテンションを10%保持した場合です:

GPUクリップアテンションの高速化エンドツーエンドの高速化
RTX PRO 6000 Blackwell16:9 · 14.4 s6.79x3.12x
RTX 409016:9 · 5.17 s4.75x1.77x
RTX 409016:9 · 10.1 s6.22x2.42x
RTX 409016:9 · 14.4 s6.31x2.82x

左がフルアテンション、右がVeda。同じプロンプト、シード、Turbo LoRAを使用し、単一のRTX PRO 6000 Blackwellで生成しました。

ハードウェアサポート

1つのTritonカーネルが、WindowsとLinux上のSM80以降のすべてのNVIDIA GPUをカバーし、AppleシリコンはMLX経由で動作します。対応するカーネルがないカードではその旨が通知され、モデルは自身のアテンションを維持します。

ハードウェアステータス
RTX 30 / A100 / RTX 40 / L40 (sm80-89)コードパスは準備済み、著者による検証は未実施
H100 / H200 (sm90)コードパスは準備済み、著者による検証は未実施
B200 / B300 (sm100 / sm103)コードパスは準備済み、著者による検証は未実施
RTX 50, RTX PRO 6000 Blackwell (sm120)検証済み: RTX 5070、Windows 11
DGX Spark / GB10 (sm121)コードパスは準備済み、著者による検証は未実施
Appleシリコン(Mシリーズ)検証済み: M3 Pro、macOS 15

はじめに

VedaにはComfyUI 0.38.0以降が必要です。ComfyUIマネージャーで「Veda」を検索してインストールするか、CLIからインストールします:

comfy node install veda-sparse-attention

次に275 MBの予測器を ComfyUI/models/veda/ に配置します:

hf download Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview \
  minimax_h3_t2va_veda_8nfe_600step_preview_fp8.safetensors \
  --local-dir ComfyUI/models/veda

このノードは自身では何もダウンロードしません。より簡単な方法は、ワークフロー -> テンプレートを参照 -> Veda-on-ComfyUI を開いてテンプレートを選ぶことです。ComfyUIの不足しているモデルのダイアログで予測器が提示されます。リポジトリには2つのサンプルワークフローが同梱されています:

入手方法

このノードはComfy Registryに veda-sparse-attention として公開されており、ソースは veda-sparse/Veda-on-ComfyUI にあります。予測器のチェックポイントは Veda-Sparse/Minimax-H3-T2VA-Veda-8NFE-600Step-Preview に、トレーニングコードは veda-sparse/Miowtion にあります。公開された予測器はプレビューとしてタグ付けされており、8ステップのTurbo LoRAを使い、5秒、10秒、14秒の1344x768、768x1344、768x768、1024x768向けにトレーニングされています。その他のサイズは最も近いトレーニング済みタイルプランにフォールバックするため、フルアテンションと比較することをお勧めします。

コメント

GitHubでサインインしてディスカッションに参加しましょう。

コメントを読み込み中…
Veda Sparse AttentionがComfyUIに登場: MiniMax H3が高速化 | ComfyUI Wiki