FastH3 Trim: un MiniMax H3 podado de 8 pasos para GPUs de 8 GB

ComfyUI Wikinews

FastVideo lanza FastH3 Trim, un MiniMax H3 podado de 42 bloques que ejecuta vídeo de 8 pasos con audio en tan solo 8 GB de memoria de GPU, con archivos reempaquetados para ComfyUI.

FastH3 Trim es una variante experimental de FastH3 V2 de FastVideo de Hao AI Lab: la misma destilación de MiniMax H3 de ocho pasos y sincronizada con audio, con 8 de los 50 bloques del transformer eliminados. Es 4.2 veces más pequeño que el H3 base y, según los números del equipo, más rápido que V2 en todos los dispositivos que probaron, hasta llegar a una RTX 4090 con la memoria limitada a 8 GB. Los pesos y un reempaquetado para ComfyUI llegaron a Hugging Face entre el 3 y el 6 de octubre, y el equipo publicó el artículo FastH3 on Consumer Hardware el 6 de octubre.
FastH3 en hardware de consumo

Qué cambia Trim

El H3 base son tres redes: un codificador de texto Qwen3-VL, un transformer de difusión de 50 bloques que aplica denoising a los latentes de vídeo y audio de forma conjunta, y dos VAE. En BF16 eso son 137.7 GiB, que no caben en una tarjeta de 32 GB. FastH3 V2 lo redujo con cuantización; Trim además elimina bloques.

Tamaño del checkpoint por componente

Tamaño del checkpoint por componente. El H3 en BF16 ocupa 137.7 GiB; la versión NVFP4 de FastH3 Trim ocupa 33.0 GiB, con el transformer en 11.1 GiB.

  • Poda de bloques: el equipo omitió un bloque a la vez del H3 base y registró cuánto cambiaban las predicciones de vídeo y audio, en cuatro tipos de ejemplo (movimiento, voz, música, eventos de sonido) con tres niveles de ruido, para un total de 600 mediciones. Cada bloque se clasificó según el mayor cambio que provocaba bajo cualquier condición, de modo que se conserva todo bloque que importe al vídeo o al audio. Los ocho bloques eliminados están todos en la primera mitad de la red; los bloques primero y último fueron los que más cambiaron la salida.
  • Acondicionamiento del timestep: H3 acondiciona cada bloque con el timestep de difusión mediante una proyección AdaLN que mapea un embedding de tiempo de 2,688 dimensiones a seis vectores de modulación, y esas proyecciones ocupan 24 GiB en BF16 a lo largo de 50 bloques. Trim las reemplaza por una base compartida de 2,688 a 16 más una pequeña proyección por bloque, almacenada en FP16 porque BF16 produce un error de reconstrucción unas 1.7 veces mayor.
  • Entrenamiento: el nuevo modelo de 42 bloques se entrenó directamente con DMD2 de ocho pasos usando el objetivo de FastH3 V2. El H3 base inicializa tanto el teacher congelado como el critic entrenable, la atención es 80% dispersa, y el muestreador da pasos en 999, 874, 749, 624, 500, 375, 250 y 125.
Tamaño del transformer de FastH3 Trim por formato

El transformer de FastH3 Trim en cada formato distribuido, dibujado a escala: el área es el tamaño del checkpoint.

Qué incluye el reempaquetado para ComfyUI

La versión está reempaquetada para ComfyUI en FastVideo/FastVideo-FastH3-Trim-Comfy. Elige un archivo de modelo de difusión más un codificador de texto compatible:

Modelo de difusiónTamañoÚsalo en
fastvideo_fasth3_trim_8step_nvfp4.safetensors11.9 GBNVIDIA Blackwell: serie RTX 50, RTX PRO 6000, DGX Spark
fastvideo_fasth3_trim_8step_fp8.safetensors19.7 GBNVIDIA Ada y posteriores: serie RTX 40
fastvideo_fasth3_trim_8step_int8_convrot.safetensors18.9 GBCualquier GPU NVIDIA reciente; coincide con el valor predeterminado de la plantilla
fastvideo_fasth3_trim_8step_bf16.safetensors37.5 GBCalidad de referencia, o para convertir a otros formatos

El repositorio también incluye codificadores de texto Qwen3-VL (BF16, INT8 ConvRot, NVFP4 AWQ) y los VAE de vídeo y audio de MiniMax H3. Cada capa NVFP4 usa escalas de activación calibradas con 1,000 prompts, y Trim tiene 294 capas calibradas.

Cómo ejecutarlo en ComfyUI

Usa la plantilla FastVideo FastH3: Text to Video que se incluye con ComfyUI (0.36.0 o posterior) y elige uno de los modelos de difusión Trim en su UNETLoader. Mantén las configuraciones del muestreador de la plantilla: 8 pasos, res_multistep, simple, y el nodo MiniMaxH3SigmaShift en 10 para vídeo y 3 para audio.

Qué tan rápido se ejecuta

Segundos de principio a fin para un clip de 5 segundos con audio, mediana de dos ejecuciones en cada uno de dos prompts, según el artículo del blog:

MáquinaV2, 480pTrim, 480pV2, 768pTrim, 768p
RTX PRO 6000 96 GB13.512.036.532.5
RTX 5090 32 GB14.813.438.635.4
RTX 4090 24 GB54.643.9154.6132.8
RTX 4090, límite de 16 GB79.972.1153.7139.9
RTX 4090, límite de 12 GB91.274.1170.7147.1
RTX 4090, límite de 8 GB-82.0--
DGX Spark 128 GB unificada141.4125.8340.1
2x DGX Spark87.278.3
Mac, M4 Max 36 GB unificada925.2

Las filas de 8 GB, 12 GB y 16 GB corresponden a la misma RTX 4090 con la memoria de GPU limitada; una tarjeta real con menos memoria será más lenta. El blog señala que en la 4090 la ruta FP8 no tiene núcleos tensor FP4 que usar, así que sortea el matmul FP8 más lento por token y por canal con un kernel fusionado por tensor más escalado de salida, y cuantiza las queries y las keys a INT8 para el cálculo de los scores.

Tiempo de principio a fin por máquina

Tiempo de principio a fin para un clip de 5 segundos a 832x480 con audio, por máquina.

Misma prompt y semilla en la RTX 5090, primero FastH3 V2 y luego FastH3 Trim:

FastH3 V2 en una RTX 5090.

FastH3 Trim en la misma RTX 5090, con la misma prompt y semilla.

Limitaciones

  • Trim está etiquetado como un experimento, no como el líder en calidad: el blog dice que eliminar bloques hace el modelo más rápido y más pequeño pero cuesta algo de calidad, y recomienda FastH3 V2 cuando la calidad es lo más importante.
  • La cifra de 8 GB es un dato exclusivo de Trim, en NVFP4, sobre una tarjeta con la memoria limitada. V2 no cabe en 12 GB en la configuración probada.
  • Trim existe solo para la línea FastH3 de ocho pasos. No modifica el modelo MiniMax H3 base, que sigue necesitando el transformer completo de 50 bloques.
  • La ruta en ComfyUI depende de que la plantilla FastH3 se incluya con ComfyUI 0.36.0 o posterior.

Disponibilidad

Reempaquetado para ComfyUI: FastVideo/FastVideo-FastH3-Trim-Comfy
Pesos fuente: FastVideo/FastVideo-FastH3-Trim-8-Step
Artículo del blog: FastH3 on Consumer Hardware
Código: hao-ai-lab/FastVideo
Contraparte en calidad: FastVideo/FastVideo-FastH3-8-Step-V2
Modelo base: MiniMaxAI/MiniMax-H3

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
FastH3 Trim: un MiniMax H3 podado de 8 pasos para GPUs de 8 GB | ComfyUI Wiki