MiniMax H3 Fused Turbo: 21 GB, Vídeo y Audio en 4 Pasos

ComfyUI Wikinews

MATLOWAI integra el turbo H3 y los Mystic LoRAs en un único archivo ComfyUI INT8 ConvRot: vídeo y referencia-a-vídeo con audio en 4 pasos, ahorrando unos 21 GB de VRAM.

MiniMax-H3 Fused Turbo (INT8 ConvRot) (Hugging Face) es un único archivo de difusión ComfyUI de 21 GB de MATLOWAI que realiza texto/imagen-a-vídeo MiniMax H3 y referencia-a-vídeo en 4 pasos, con un turbo destilado y un LoRA de suavizado de movimiento ya integrado en los pesos. Sin cargadores LoRA, sin vuelta de cuantización y aproximadamente 21 GB menos de VRAM que la configuración equivalente con LoRAs activos.

La ejecución de referencia de paso único en 4 pasos: 1152x640, 243 fotogramas (10 s con audio), 76 segundos en una RTX PRO 6000.

Qué contiene el archivo

La integración comienza desde el transformador fl2va podado con un SVD de rango-1024 del delta de peso (ref2va - fl2va) fusionado, por lo que una partición sirve tanto para el acondicionamiento de primer/último fotograma como para el acondicionamiento de referencia. Además de eso:

FusionadoFuerzaFuente
lightx2v FL2VA Turbo 8-step v1.01.0Kijai/MiniMax-H3_comfy, redimensionar rango-24 (original)
Mystic v2.0 (suavizado de movimiento)0.7Civitai model 2856467

Un único paso de cuantización INT8 ConvRot se ejecuta después de la fusión: los cuatro pesos Lineales pesados en cada uno de los 50 bloques (qkv_proj, out_proj, fc1, fc2) son INT8 con ConvRot (grupo 256, por canal) en el diseño nativo comfy_quant de ComfyUI, todo lo demás permanece BF16/F32. Ese orden importa: cuantizar los pesos fusionados evita la deriva de base cuantizada con deltas FLOTANTES, y las pruebas con misma semilla midieron la integración idéntica a la ruta de LoRA activo.

Por qué fusionar en lugar de apilar LoRAs

Los dos archivos LoRA suman aproximadamente 540 MB, por lo que los adaptadores no son el problema. Un LoRA es un delta de bajo rango que ComfyUI agrega en el momento de carga; para permanecer eliminable mantiene una copia intacta de cada peso que toca. Parchear las 200 Capas principales de un modelo INT8 y esa copia de seguridad es un segundo modelo completo en Memoria. Medido dos veces a 8 pasos con la misma Semilla:

ConfiguraciónVRAM picoResidenteTiempo transcurrido
Integrado (este archivo)47.8 GB42 GB103 s
LoRAs activos68.9 GB64 GB103 s

Misma toma, mismo tiempo transcurrido, medidores de audio idénticos dentro del ruido. La fusión simplemente elimina dos cargadores, una vuelta de cuantización y la copia de seguridad de parche de ~21 GB. Si necesita ajustar las intensidades de LoRA, el README documenta la ruta equivalente activa con archivos públicos.

Pasos: dice 8, ejecútalo a 4

El turbo fusionado es el LoRA de 8 pasos de lightx2v, pero es un modelo de 4 u 8 NFE. La escalera medida en una RTX PRO 6000 (96 GB), 1152x640, 243 fotogramas, Atención dispersa SLA:

PipelinePasosTiempo
Referencia, paso único476 s
Referencia, paso único680 s
Referencia, paso único8103 s
Referencia, paso único25292 s
De-rope (4 + 4)4 + 4~374 s

La misma toma a 25 pasos: un dibujo un poco más nítido, 292 segundos en lugar de 76, banda sonora sin cambios.

El De-rope es la razón para ejecutar 4 pasos: el pase 2 solo gasta pasos en los fotogramas que el oráculo de sacudidas Marcado, por lo que 4 + 4 juntos cuestan aproximadamente lo mismo que un pase de 25 pasos mientras las regiones retenidas salen más limpias. Dos hallazgos de la receta importan: res_multistep supera a euler para la calidad de audio a 4 pasos (los gráficos de ejemplo de lightx2v dicen euler), y la Atención bloque-dispersa SLA al 0.90 de dispersión es audible, restaurando detalles de banda sonora de gama Alta que la atención densa aplana mientras se ejecuta aproximadamente un 40% más rápido.

Flujos de trabajo

El repositorio incluye cinco gráficos de ComfyUI (formato UI y API), cada uno con una sola caja PROMPT alimentando cada etapa. Requiere ComfyUI-MAINodes y un Paquete de Nodos de atención dispersa SLA:

Primeros Pasos

  1. Descargue minimax_h3_fused_refdelta_r1024_turbo8_mystic07_int8_convrot.safetensors (21 GB) en ComfyUI/models/diffusion_models/ y cárguelo con un UNetLoader estándar, weight_dtype default. No se necesita cargador de cuantización Personalizado.
  2. Descargue los archivos acompañantes de Comfy-Org/MiniMax-H3: minimax_h3_video_vae_int8_convrot.safetensors, minimax_h3_audio_vae_fp32.safetensors (VAEs) y qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors (codificador de texto).
  3. Instale ComfyUI-MAINodes y un Paquete de Nodos de atención dispersa SLA, luego arrastre un Flujo de trabajo anterior.

Las tarjetas más pequeñas también funcionan: la gestión de modelos de ComfyUI carga y descarga el transformador, codificador de texto y VAEs según sea necesario, por lo que los mismos gráficos se ejecutan, solo más lento. En AMD/ROCm, la receta se desarrolló en una caja AMD con la bifurcación ComfyUI ROCm de patientx, que también lleva una compilación ROCm del Nodo de atención SLA.

Enlaces

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3 Fused Turbo: 21 GB, Vídeo y Audio en 4 Pasos | ComfyUI Wiki