MiniMax H3 FL2V Turbo 4 Pasos v1.2 LoRA: Audio Más Limpio

ComfyUI Wikinews

Descargar minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16.safetensors: Actualización de 4 pasos de MiniMax H3 Turbo de LightX2V con generación de audio más limpia y estable.

El Equipo LightX2V lanzó FL2V Turbo 4-pasos v1.2 768p, la entrada más reciente en la línea de destilación Minimax-h3-Turbo. v1.2 mantiene la configuración de generación rápida de 4 pasos igual que v1.1 y se enfoca completamente en una debilidad: calidad de audio. La comparación del lanzamiento muestra un audio generado más limpio y estable con menos artefactos en configuraciones idénticas (discusión del lanzamiento).

MiniMax H3 FL2V Turbo v1.2 ejemplo de cuadro

Qué cambió en v1.2

v1.2 es una actualización de calidad de audio de la LoRA FL2V (primer/último frame) de 4 pasos 768p en lugar de una nueva arquitectura:

  • Audio más limpio y estable con menos artefactos
  • Misma configuración de generación de 4 pasos (NFE 4) que v1.1
  • Ambos pesos Diffusers y ComfyUI bf16 publicados lado a lado
ArchivoFormato
minimax_h3_fl2v_turbo_4step_v1.2_768p_bf16.safetensorsDiffusers
minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16.safetensorsComfyUI, sin conversión necesaria

Comparativa v1.1 vs v1.2 (habilitar audio)

El equipo compartió comparativas lado a lado utilizando la misma entrada, prompt, semilla y configuraciones de inferencia:

v1.1v1.2

Configuraciones recomendadas

AjusteValor
Pasos4
Desplazamiento de vídeo6
Desplazamiento de audio3
MuestreadorEuler
ResoluciónHasta 768p

Los desplazamientos de vídeo y audio se configuran a través del nodo ModelSamplingMiniMaxH3, conectado después del cargador de modelo de difusión. Nota que algunos probadores tempranos en el hilo de discusión de Hugging Face sintieron que la calidad visual sufrió en comparación con v1.1, así que si la calidad de vídeo importa más que el audio en tu pipeline, mantener v1.1 es una elección razonable.

Uso de ComfyUI

MiniMax H3 tiene soporte nativo de ComfyUI, por lo que no se requiere ningún nodo personalizado para la LoRA:

  1. Descargar minimax_h3_fl2v_turbo_4step_v1.2_768p_comfyui_bf16.safetensors en ComfyUI/models/loras/.
  2. Cargar el checkpoint base de MiniMax H3 y aplicar la LoRA entre el cargador de modelo y el muestreador.
  3. Establecer 4 pasos de muestreo, muestreador Euler, desplazamiento de vídeo 6 y desplazamiento de audio 3 a través de ModelSamplingMiniMaxH3, luego generar hasta 768p.

Los gráficos de ejemplo propios del proyecto en ModelTC/Minimax-H3-Turbo también están actualizados; los gráficos T2VA/I2VA son la coincidencia más cercana para la ruta FL2V.

Disponibilidad

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
MiniMax H3 FL2V Turbo 4 Pasos v1.2 LoRA: Audio Más Limpio | ComfyUI Wiki