MiniMax H3 Acc LoRA: Destilación PDD Oficial de 8 Pasos en ComfyUI
Alibaba PAI envía LoRAs de aceleración PDD para MiniMax H3: generación completa de audio y vídeo en 8 o 4 pasos de Muestreador sin CFG, más un paquete de Nodos nativo de ComfyUI.
Qué es
Los dos archivos -Acc-8Step no son LoRAs ordinarios. Junto con una LoRA troncal de rango-64 (network_alpha = 64, BF16), cada checkpoint lleva una banco de cabezales de Destilación de Decodificación Paralela: 32 copias por intervalo de las proyecciones de vídeo y audio de la capa final que se fusionan en un único cabezal de velocidad media-bloque en cada paso de Muestreador. Un cargador de LoRA simple no puede leer estos archivos, y omitir el banco de cabezales pierde la destilación de forma silenciosa.
- 8 pasos, sin CFG — la generación se ejecuta en
guidance_scale = 1.0con un solo pase directo por paso; la orientación se destila en el adaptador. - Audio + vídeo en un pase — la destilación cubre el flujo de audio conjunto, no solo los fotogramas visuales.
- Dos troncales — un adaptador apunta al checkpoint FL2VA (condicionado por texto/primer-último fotograma), el otro al checkpoint Ref2VA (condicionado por referencia).
- Lanzamiento oficial — publicado por Alibaba PAI el 26 de agosto de 2026, siguiendo el Método PDD de Shaul et al. (arXiv 2607.26004).
Pesos
| Archivo | Tamaño | Objetivo base | Enlace |
|---|---|---|---|
MiniMax-H3-FL2VA-Acc-8Step.safetensors | 1.4 GB | MiniMax-H3 (FL2VA) | HF |
MiniMax-H3-Ref2VA-Acc-8Step.safetensors | 1.4 GB | MiniMax-H3 (Ref2VA) | HF |
Cada archivo pesa 1.4 GB en BF16, rango 64, y se aplica con fuerza 1.0 sobre el transformador H3 base. Empareje el adaptador FL2VA con un UNET FL2VA y el adaptador Ref2VA con un UNET Ref2VA (originales bf16 o construcciones int8 convrot funcionan ambas).
Resultados
Muestras de demostración oficiales generadas con el adaptador Acc-8Step con un peso de LoRA de 1.0:
FL2VA
Texto a vídeo con el adaptador FL2VA Acc-8Step
Ref2VA
Referencia a vídeo con el adaptador Ref2VA Acc-8Step
La tarjeta del modelo también incluye comparaciones lado a lado contra la línea base no destilada y las LoRAs comunitarias Minimax-h3-Turbo de 4 pasos para ambos troncales.
Soporte ComfyUI
ComfyUI-MiniMax-H3-PDD-Acc de Jalen-Brunson añade Nodos nativos de ComfyUI para el lanzamiento. El nodo MiniMaxH3PDDAccApply aplica la LoRA troncal e instala el banco de cabezales PDD en la capa final, armado por paso mediante sigma, para que los Muestreadores de bucle y fragmentados permanezcan sincronizados. El nodo scheduler compañero emite la cuadrícula sigma entrenada para flujos de trabajo de denoise parcial.
La receta entrenada es estricta:
- Muestreador — Euler; cada paso consume una velocidad media de bloque, por lo que los Muestreadores multietapa evalúan fuera de la cuadrícula.
- Pasos — 8 (predeterminado, el tamaño de bloque entrenado), 4 (reasignación sancionada oficialmente), o 6 (partición no uniforme
8,8,4,4,4,4). Otros conteos de pasos son rechazados por el Nodo en lugar de degradarse silenciosamente. - Orientación — CFG 1.0 con
BasicGuider. - Desplazamiento sigma — exactamente 12.0 / 3.0.
- Checkpoints podados — en UNETs H3 podados (tabla de CURVA) los 50 módulos LoRA dense-adaLN se rebasean automáticamente sobre la base de CURVA del modelo.
Elimine otras LoRAs de destilación (lightx2v turbo, etc.) al usar estos adaptadores — las destilaciones no se apilan. Las LoRAs de personajes se apilan normalmente.
Se admiten dos formatos: los archivos originales de Alibaba (convertidos en Memoria por el Nodo) o la redistribución preconvertida con clave ComfyUI por aptech0081/MiniMax-H3-Acc-LoRAs-ComfyUI (1.7 GB por archivo).
Disponibilidad
Fuera de ComfyUI, los adaptadores se ejecutan a través de la pipeline de inferencia VideoX-Fun. Establezca model_path y pdd_lora_path en los scripts de ejemplo predict_t2v.py (FL2VA) o predict_ref2v.py (Ref2VA) de VideoX-Fun, que utilizan el ModularPipeline de MiniMax-H3 de Diffusers y requieren diffusers >= 0.40.0. Cada ejemplo carga el checkpoint con apply_pdd_lora y deriva el número requerido de pasos de inferencia desde su configuración.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.