VDN-H3: vídeo MiniMax H3 más rápido con atención híbrida
El checkpoint Video DeltaNet de OpenVDN para MiniMax H3 renderiza un clip 768p de 14,4 s en 8 pasos, con puerto ComfyUI comunitario disponible.
El puerto de la comunidad ejecuta los checkpoints VDN-H3 publicados como parches de modelo en tiempo de ejecución sobre el nodo MiniMax-H3 nativo de ComfyUI, sin modificar el núcleo.
Cómo acelera Video DeltaNet el H3
En un modelo omni de frontera como MiniMax H3, la atención softmax sobre secuencias largas de tokens representa más del 85 % del tiempo de ejecución total, y su coste crece de forma cuadrática con la duración del clip. Video DeltaNet divide la atención vídeo-vídeo en dos ramas complementarias: una rama softmax bidireccional de ventana deslizante que mantiene la atención exacta entre fotogramas cercanos (detalle fino y estabilidad a corto plazo), y una rama de atención lineal bidireccional que transporta el contexto de largo alcance a través de un estado recurrente de coste constante. Un esquema de anclas de frontera en 4 direcciones añade solo un 3,57 % de densidad de atención mientras mantiene la consistencia global, de modo que el primer y el último fotograma de un clip permanecen visibles para todos los demás.
El checkpoint no sustituye el backbone de H3. Incluye una rama de atención lineal independiente además de dos pequeños adaptadores LoRA que se fusionan con el backbone durante la inferencia, dejando los pesos originales intactos. Junto con el cambio de arquitectura, el modelo de 8 pasos es una destilación DMD del modelo de 50 pasos.
Rendimiento y calidad
Las cifras principales provienen de la configuración de centro de datos: en 8 GPU B200, VDN-H3 genera un clip de 14,4 segundos a 768p en 11,23 segundos con 8 pasos de denoising. Comparaciones con una sola GPU frente a la línea base del H3 denso:
| Configuración | GPU | 50 NFE (VDN-H3-50-step) | 8 NFE (VDN-H3-8-step) |
|---|---|---|---|
| MiniMax-H3 denso (H200) | 1 | 27,3 min | 4,4 min |
| VDN-H3 FP8 (H200) | 1 | 9,4 min | 90,5 s |
| MiniMax-H3 denso (B200) | 1 | 13,95 min | 2,23 min |
| VDN-H3 FP8 (B200) | 1 | 5,3 min | 51 s |
El equipo informa de que el modelo híbrido es visualmente casi indistinguible de la salida del H3 denso y muestra una calidad superior y un mejor seguimiento de las instrucciones que MiniMax FastH3. Las comparaciones de muestras, incluidos los clips lado a lado frente al H3 denso y FastH3, están en la página del proyecto.
Muestra de salida del VDN-H3 de 8 pasos procedente de la página del proyecto.
Ejecutarlo en ComfyUI
El lanzamiento oficial apunta a un stack de centro de datos: 8x B200 con paralelismo de secuencia Ulysses y kernels FlashAttention-4 que solo admiten Hopper y Blackwell de centro de datos. No hay compilaciones oficiales para Windows, y Blackwell de consumo (sm_120) no es compatible con los kernels FA4.
El puerto ComfyUI-VDN-H3 reproduce las matemáticas oficiales de la atención híbrida como parches de modelo en tiempo de ejecución sobre el modelo MiniMax-H3 nativo de ComfyUI, sustituyendo las capas lineales FP8 y los kernels Triton fusionados por equivalentes PyTorch portables. Cuenta con pruebas unitarias frente a la implementación oficial y no requiere ninguna dependencia nueva. Para instalar:
- Clona el repositorio en
ComfyUI/custom_nodes/y reinicia ComfyUI. - Descarga la etapa del checkpoint que quieras en
ComfyUI/models/vdn/, manteniendo intacta la estructura de directorios (model_spec.json,linear_branch/,adapters/):
hf download OpenVDN/vdn-minimax-h3 --include "stage-dmd-step-250/*" --local-dir <ComfyUI>/models/vdnLa descarga de 8 pasos stage-dmd-step-250 pesa aproximadamente 5 GB (rama lineal más adaptadores); la variante de 50 pasos stage-b-step-2000 ocupa unos 4,3 GB.
Lo que el puerto no ofrece es la velocidad destacada: la cifra oficial de 74,5x combina paralelismo de 8 GPU, FA4, FP8 y destilación de 8 pasos. La medición propia de upstream con una sola GPU es de aproximadamente 2,6x a 50 pasos, y los kernels portables del puerto se quedan algo por debajo de esa cifra (medidos en torno a 17 s/it a 1280x736 / 145 fotogramas en una RTX 5090). Los benchmarks de la comunidad en los canales de Banodoco H3 cronometraron el VDN-H3 Turbo de 8 pasos en 2:04 para 1280x736 frente a 1:24 del turbo LightXv2 de 4 pasos en el mismo hardware, y los comentaristas señalan que VDN maneja mejor el movimiento rápido que la ruta de FastH3.
El mismo prompt con H3 denso a 50 pasos (parte superior de la comparación en la página del proyecto).
Disponibilidad
- Pesos: OpenVDN/vdn-minimax-h3 en Hugging Face (Licencia comunitaria de MiniMax H3; ten en cuenta que excluye algunos territorios)
- Código oficial: OpenVDN/vdn-minimax-h3 (Apache-2.0), con código de inferencia y entrenamiento y una página del proyecto
- Puerto de ComfyUI: Saganaki22/ComfyUI-VDN-H3
Comentarios
Inicia sesión con GitHub para unirte a la conversación.