MiniMax H3 Hybrid Merge: Calidad FL2VA y Referencias Ref2VA
La fusión comunitaria combina la calidad de MiniMax H3 FL2VA con el condicionamiento por referencia de Ref2VA en un solo checkpoint, con nodo Hybrid Loader para ComfyUI.
MiniMax H3 se distribuye como dos checkpoints con la misma arquitectura: FL2VA, que produce la mayor calidad visual y de audio, y Ref2VA, la única variante que admite generación basada en referencias (acondicionamiento por referencia de imagen, vídeo o audio), pero con una calidad de salida notablemente peor. Un proyecto de la comunidad ahora fusiona los dos en un único checkpoint MiniMax H3 Hybrid, y un nodo personalizado complementario lo carga directamente en ComfyUI.
Configuraciones recomendadas del Hybrid Loader según el README oficial del proyecto
Por qué existe la fusión
Una comparación tensor por tensor de los dos checkpoints oficiales reveló que la gran mayoría de los pesos (proyecciones de Atención QKV/salida, MLPs, RMSNorms, proyecciones de parches, embeddings rotatorios y el refinador de tokens) son bit-idénticos o extremadamente cercanos (similitud coseno ≥ 0.9997) entre FL2VA y Ref2VA. Las diferencias significativas se concentran en los pesos adaln_proj por bloque: las proyecciones de modulación AdaLN que enrutan las señales de modalidad de texto, audio, vídeo y referencia hacia el flujo residual.
Dado que el procesamiento del acondicionamiento de referencia se localiza en esos pesos AdaLN de los bloques posteriores, mientras que la fidelidad visual/auditiva general reside en pesos compartidos, una fusión dirigida parecía prometedora en lugar de un compromiso con pérdidas: tomar FL2VA como modelo base para todo lo demás y extraer los pesos adaln_proj de Ref2VA para un rango configurable de bloques de transformador posteriores.
Variantes disponibles
La fusión se realizó a nivel de tensor sin entrenamiento adicional. Todas las variantes usan FL2VA como base y solo se diferencian en cuántos de los 50 bloques de transformador toman sus pesos adaln_proj de Ref2VA:
| Archivo | Bloques de Ref2VA | Compensación |
|---|---|---|
minimax_h3_hybrid_fl2va_ref2va_b30-49.safetensors | 30–49 (últimos 20) | Más cercano a FL2VA: mayor calidad de salida, capacidad de referencia reducida |
minimax_h3_hybrid_fl2va_ref2va_b25-49.safetensors | 25–49 (últimos 25) | Equilibrio predeterminado RECOMENDADO |
minimax_h3_hybrid_fl2va_ref2va_b20-49.safetensors | 20–49 (últimos 30) | Más cercano a Ref2VA: mejor adherencia a la referencia, calidad ligeramente inferior |
minimax_h3_hybrid_fl2va_ref2va_b15-49.safetensors | 15–49 (últimos 35) | Mayor capacidad de referencia, cierta pérdida de calidad |
Cada variante es un checkpoint autocontenido con la misma arquitectura y disposición de tensores que los modelos fuente (~21 GB), por lo que se comporta como un modelo de difusión normal una vez cargado.
Uso en ComfyUI
El híbrido no se puede cargar con el nodo Load Diffusion Model estándar de ComfyUI, porque ningún cargador estándar sabe cómo componer dos checkpoints. El MiniMax H3 Hybrid Loader complementario (ComfyUI_MinimaxH3HybridLoader) cubre esa carencia:
- Instalar el nodo personalizado en
ComfyUI/custom_nodes/y reiniciar ComfyUI. Aparece en modelo/cargadores comoMiniMax H3 Hybrid Loader. - Establecer el Modelo base como el checkpoint FL2VA y el Modelo superpuesto como el checkpoint Ref2VA.
- Elegir un preajuste:
ref2va_adaln_over_fl2va(solo AdaLN por bloque de Ref2VA) oblock_range_adalnconblock_range_start/block_range_endpara un control más fino (los bloques se indexan de 0 a 49). - El cargador entrega el diccionario de estados fusionado al cargador de modelos estándar de ComfyUI, por lo que el resultado es indistinguible de un modelo cargado por
Load Diffusion Model: mismo patcher, mismo soporte multigpu, y los archivos int8.comfy_quantasociados se cargan automáticamente junto con él.
El cargador es eficiente en el uso de memoria: ambos archivos safetensors se abren mediante mmap y se fusionan un tensor a la vez, por lo que el pico de RSS se mantiene en torno al tamaño de un modelo en lugar de dos.
Disponibilidad
- Pesos: smhfacct/Minimax-H3-fl2va-ref2va-hybrid-models en Hugging Face (cuatro variantes, ~21 GB cada una)
- Nodo de ComfyUI: scottmudge/ComfyUI_MinimaxH3HybridLoader en GitHub, con un análisis completo tensor por tensor en
minimax_h3_analysis.md - Ambos checkpoints fuente permanecen sin modificaciones; la fusión hereda los términos de licencia originales de MiniMax H3
Comentarios
Inicia sesión con GitHub para unirte a la conversación.