MiniMax H3 Acc LoRA: Destilación PDD Oficial de 8 Pasos en ComfyUI

ComfyUI Wikinews

Alibaba PAI envía LoRAs de aceleración PDD para MiniMax H3: generación completa de audio y vídeo en 8 o 4 pasos de Muestreador sin CFG, más un paquete de Nodos nativo de ComfyUI.

MiniMax-H3-Acc-LoRAs (Hugging Face | VideoX-Fun | arXiv) es un lanzamiento oficial de Alibaba PAI que aplica la Destilación de Decodificación Paralela (PDD) a MiniMax H3. Dos adaptadores de aceleración generan vídeo conjunto más audio sincronizado en 8 o 4 pasos de Muestreador sin orientación libre de clasificador, y un paquete de Nodos dedicado de ComfyUI lleva el lanzamiento a flujos de trabajo nativos de ComfyUI.
Caso de prueba Ref2VA de la tarjeta del modelo

Qué es

Los dos archivos -Acc-8Step no son LoRAs ordinarios. Junto con una LoRA troncal de rango-64 (network_alpha = 64, BF16), cada checkpoint lleva una banco de cabezales de Destilación de Decodificación Paralela: 32 copias por intervalo de las proyecciones de vídeo y audio de la capa final que se fusionan en un único cabezal de velocidad media-bloque en cada paso de Muestreador. Un cargador de LoRA simple no puede leer estos archivos, y omitir el banco de cabezales pierde la destilación de forma silenciosa.

  • 8 pasos, sin CFG — la generación se ejecuta en guidance_scale = 1.0 con un solo pase directo por paso; la orientación se destila en el adaptador.
  • Audio + vídeo en un pase — la destilación cubre el flujo de audio conjunto, no solo los fotogramas visuales.
  • Dos troncales — un adaptador apunta al checkpoint FL2VA (condicionado por texto/primer-último fotograma), el otro al checkpoint Ref2VA (condicionado por referencia).
  • Lanzamiento oficial — publicado por Alibaba PAI el 26 de agosto de 2026, siguiendo el Método PDD de Shaul et al. (arXiv 2607.26004).

Pesos

ArchivoTamañoObjetivo baseEnlace
MiniMax-H3-FL2VA-Acc-8Step.safetensors1.4 GBMiniMax-H3 (FL2VA)HF
MiniMax-H3-Ref2VA-Acc-8Step.safetensors1.4 GBMiniMax-H3 (Ref2VA)HF

Cada archivo pesa 1.4 GB en BF16, rango 64, y se aplica con fuerza 1.0 sobre el transformador H3 base. Empareje el adaptador FL2VA con un UNET FL2VA y el adaptador Ref2VA con un UNET Ref2VA (originales bf16 o construcciones int8 convrot funcionan ambas).

Resultados

Muestras de demostración oficiales generadas con el adaptador Acc-8Step con un peso de LoRA de 1.0:

FL2VA

Texto a vídeo con el adaptador FL2VA Acc-8Step

Ref2VA

Referencia a vídeo con el adaptador Ref2VA Acc-8Step

La tarjeta del modelo también incluye comparaciones lado a lado contra la línea base no destilada y las LoRAs comunitarias Minimax-h3-Turbo de 4 pasos para ambos troncales.

Soporte ComfyUI

ComfyUI-MiniMax-H3-PDD-Acc de Jalen-Brunson añade Nodos nativos de ComfyUI para el lanzamiento. El nodo MiniMaxH3PDDAccApply aplica la LoRA troncal e instala el banco de cabezales PDD en la capa final, armado por paso mediante sigma, para que los Muestreadores de bucle y fragmentados permanezcan sincronizados. El nodo scheduler compañero emite la cuadrícula sigma entrenada para flujos de trabajo de denoise parcial.

La receta entrenada es estricta:

  • Muestreador — Euler; cada paso consume una velocidad media de bloque, por lo que los Muestreadores multietapa evalúan fuera de la cuadrícula.
  • Pasos — 8 (predeterminado, el tamaño de bloque entrenado), 4 (reasignación sancionada oficialmente), o 6 (partición no uniforme 8,8,4,4,4,4). Otros conteos de pasos son rechazados por el Nodo en lugar de degradarse silenciosamente.
  • Orientación — CFG 1.0 con BasicGuider.
  • Desplazamiento sigma — exactamente 12.0 / 3.0.
  • Checkpoints podados — en UNETs H3 podados (tabla de CURVA) los 50 módulos LoRA dense-adaLN se rebasean automáticamente sobre la base de CURVA del modelo.

Elimine otras LoRAs de destilación (lightx2v turbo, etc.) al usar estos adaptadores — las destilaciones no se apilan. Las LoRAs de personajes se apilan normalmente.

Se admiten dos formatos: los archivos originales de Alibaba (convertidos en Memoria por el Nodo) o la redistribución preconvertida con clave ComfyUI por aptech0081/MiniMax-H3-Acc-LoRAs-ComfyUI (1.7 GB por archivo).

Disponibilidad

Fuera de ComfyUI, los adaptadores se ejecutan a través de la pipeline de inferencia VideoX-Fun. Establezca model_path y pdd_lora_path en los scripts de ejemplo predict_t2v.py (FL2VA) o predict_ref2v.py (Ref2VA) de VideoX-Fun, que utilizan el ModularPipeline de MiniMax-H3 de Diffusers y requieren diffusers >= 0.40.0. Cada ejemplo carga el checkpoint con apply_pdd_lora y deriva el número requerido de pasos de inferencia desde su configuración.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3 Acc LoRA: Destilación PDD Oficial de 8 Pasos en ComfyUI | ComfyUI Wiki