MiniMax H3 TRT VAE: decodificación H3 1.7x más rápida en ComfyUI

ComfyUI Wikinews

Un paquete de nodos ComfyUI compila el VAE de vídeo de MiniMax H3 a TensorRT y reduce el decodificado del VAE hasta 1.7x, con un decodificador w4a16 para poca VRAM.

ComfyUI-H3VAE_TRT ejecuta el VAE de vídeo MiniMax H3 a través de TensorRT. Compila el VAE una vez y luego reutiliza el motor: el nodo reporta una codificación y decodificación VAE hasta 1.7x más rápidas en ComfyUI.
Vista previa del nodo y del flujo de trabajo desde el README del proyecto

Vista previa del README del proyecto: los nodos de compilación y carga de TRT VAE dentro de un gráfico de ComfyUI.

La decodificación VAE es un coste fijo en cada ejecución de H3. Los kernels integrados de ComfyUI ya redujeron ese coste en el lado de PyTorch; este nodo toma la otra ruta y entrega el VAE a un motor TensorRT compilado.

Qué hace el nodo

El paquete incluye dos nodos y una ruta ONNX hacia el motor:

  • MiniMax-H3 TRT VAE Compiler toma el codificador y el decodificador ONNX y construye motores TensorRT. Este es un paso que se realiza una sola vez, y los motores compilados se reutilizan después.
  • MiniMax-H3 TRT VAE Loader carga los motores compilados para poder usarlos en lugar del VAE habitual.

Los pesos se publican como archivos ONNX en Hugging Face y se colocan en ComfyUI/models/vae. El paquete también incluye un compile.py independiente para construir los motores fuera de ComfyUI, lo que resulta útil cuando el paso de compilación no debe bloquear la interfaz.

Configuración

PasoAcción
1git clone https://github.com/lihaoyun6/ComfyUI-H3VAE_TRT en ComfyUI/custom_nodes e instalar requirements.txt
2Descargar el codificador y el decodificador ONNX en ComfyUI/models/vae
3Ejecutar MiniMax-H3 TRT VAE Compiler una vez para construir los motores
4Cambiar el VAE del flujo de trabajo a MiniMax-H3 TRT VAE Loader

El repositorio ONNX también incluye una variante de decodificador w4a16_awq, que el README recomienda cuando la GPU no dispone de 12 GB o más de VRAM.

Notas del rastreador de problemas

Vale la pena leer los problemas del repositorio antes de compilar, porque las compilaciones de TensorRT son sensibles al entorno instalado:

  • La compilación del motor es lenta. Un informe midió más de cinco horas para una sola compilación, por lo que la primera compilación conviene hacerla con antelación en lugar de a mitad de sesión.
  • Las versiones de TensorRT y CUDA tienen que coincidir. Hay informes abiertos sobre TensorRT 11.2 con CUDA 13.0, y un error de uso de la API IBuilder::buildSerializedNetwork en otra configuración.
  • Se reportó un patrón de cuadrícula que el codificador compilado dejaba en los fotogramas primero, último y de referencia, y se corrigió a principios de septiembre, por lo que una compilación desde el main actual lo evita.

Disponibilidad

El paquete de nodos y los pesos ONNX son públicos:

Paquete de nodos: lihaoyun6/ComfyUI-H3VAE_TRT
Pesos ONNX: lihaoyun6/MiniMax-H3-VAE-ONNX
Modelo base: MiniMaxAI/MiniMax-H3

El paquete no incluye un flujo de trabajo de ejemplo: el compilador y el cargador se insertan en un gráfico H3 existente en lugar del nodo VAE estándar.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3 TRT VAE: decodificación H3 1.7x más rápida en ComfyUI | ComfyUI Wiki