VDN-H3: vídeo MiniMax H3 más rápido con atención híbrida

ComfyUI Wikinews

El checkpoint Video DeltaNet de OpenVDN para MiniMax H3 renderiza un clip 768p de 14,4 s en 8 pasos, con puerto ComfyUI comunitario disponible.

VDN-H3 (pesos, código) es una reelaboración de MiniMax H3 con atención híbrida realizada por un equipo de UC Berkeley / Impossible, Inc. / UT Austin. Sustituye la atención cuadrática de largo alcance de H3 por una rama lineal de «Video Delta Attention», se distribuye como un checkpoint de 50 pasos y un checkpoint destilado de 8 pasos que se aplican como parche sobre el backbone de H3 sin modificar, y reporta una calidad casi sin pérdidas frente al H3 denso. Ya hay disponible un puerto nativo de ComfyUI: Saganaki22/ComfyUI-VDN-H3.
VDN-H3 ejecutándose como nodo nativo de ComfyUI

El puerto de la comunidad ejecuta los checkpoints VDN-H3 publicados como parches de modelo en tiempo de ejecución sobre el nodo MiniMax-H3 nativo de ComfyUI, sin modificar el núcleo.

Cómo acelera Video DeltaNet el H3

En un modelo omni de frontera como MiniMax H3, la atención softmax sobre secuencias largas de tokens representa más del 85 % del tiempo de ejecución total, y su coste crece de forma cuadrática con la duración del clip. Video DeltaNet divide la atención vídeo-vídeo en dos ramas complementarias: una rama softmax bidireccional de ventana deslizante que mantiene la atención exacta entre fotogramas cercanos (detalle fino y estabilidad a corto plazo), y una rama de atención lineal bidireccional que transporta el contexto de largo alcance a través de un estado recurrente de coste constante. Un esquema de anclas de frontera en 4 direcciones añade solo un 3,57 % de densidad de atención mientras mantiene la consistencia global, de modo que el primer y el último fotograma de un clip permanecen visibles para todos los demás.

El checkpoint no sustituye el backbone de H3. Incluye una rama de atención lineal independiente además de dos pequeños adaptadores LoRA que se fusionan con el backbone durante la inferencia, dejando los pesos originales intactos. Junto con el cambio de arquitectura, el modelo de 8 pasos es una destilación DMD del modelo de 50 pasos.

Rendimiento y calidad

Las cifras principales provienen de la configuración de centro de datos: en 8 GPU B200, VDN-H3 genera un clip de 14,4 segundos a 768p en 11,23 segundos con 8 pasos de denoising. Comparaciones con una sola GPU frente a la línea base del H3 denso:

ConfiguraciónGPU50 NFE (VDN-H3-50-step)8 NFE (VDN-H3-8-step)
MiniMax-H3 denso (H200)127,3 min4,4 min
VDN-H3 FP8 (H200)19,4 min90,5 s
MiniMax-H3 denso (B200)113,95 min2,23 min
VDN-H3 FP8 (B200)15,3 min51 s

El equipo informa de que el modelo híbrido es visualmente casi indistinguible de la salida del H3 denso y muestra una calidad superior y un mejor seguimiento de las instrucciones que MiniMax FastH3. Las comparaciones de muestras, incluidos los clips lado a lado frente al H3 denso y FastH3, están en la página del proyecto.

Muestra de salida del VDN-H3 de 8 pasos procedente de la página del proyecto.

Ejecutarlo en ComfyUI

El lanzamiento oficial apunta a un stack de centro de datos: 8x B200 con paralelismo de secuencia Ulysses y kernels FlashAttention-4 que solo admiten Hopper y Blackwell de centro de datos. No hay compilaciones oficiales para Windows, y Blackwell de consumo (sm_120) no es compatible con los kernels FA4.

El puerto ComfyUI-VDN-H3 reproduce las matemáticas oficiales de la atención híbrida como parches de modelo en tiempo de ejecución sobre el modelo MiniMax-H3 nativo de ComfyUI, sustituyendo las capas lineales FP8 y los kernels Triton fusionados por equivalentes PyTorch portables. Cuenta con pruebas unitarias frente a la implementación oficial y no requiere ninguna dependencia nueva. Para instalar:

  1. Clona el repositorio en ComfyUI/custom_nodes/ y reinicia ComfyUI.
  2. Descarga la etapa del checkpoint que quieras en ComfyUI/models/vdn/, manteniendo intacta la estructura de directorios (model_spec.json, linear_branch/, adapters/):
hf download OpenVDN/vdn-minimax-h3 --include "stage-dmd-step-250/*" --local-dir <ComfyUI>/models/vdn

La descarga de 8 pasos stage-dmd-step-250 pesa aproximadamente 5 GB (rama lineal más adaptadores); la variante de 50 pasos stage-b-step-2000 ocupa unos 4,3 GB.

Lo que el puerto no ofrece es la velocidad destacada: la cifra oficial de 74,5x combina paralelismo de 8 GPU, FA4, FP8 y destilación de 8 pasos. La medición propia de upstream con una sola GPU es de aproximadamente 2,6x a 50 pasos, y los kernels portables del puerto se quedan algo por debajo de esa cifra (medidos en torno a 17 s/it a 1280x736 / 145 fotogramas en una RTX 5090). Los benchmarks de la comunidad en los canales de Banodoco H3 cronometraron el VDN-H3 Turbo de 8 pasos en 2:04 para 1280x736 frente a 1:24 del turbo LightXv2 de 4 pasos en el mismo hardware, y los comentaristas señalan que VDN maneja mejor el movimiento rápido que la ruta de FastH3.

El mismo prompt con H3 denso a 50 pasos (parte superior de la comparación en la página del proyecto).

Disponibilidad

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
VDN-H3: vídeo MiniMax H3 más rápido con atención híbrida | ComfyUI Wiki