ComfyUI MiniMax H3 SPEED V2: resolución progresiva multi-muestreador

ComfyUI Wikinews

ComfyUI-MiniMax-H3-SPEED V2 añade Euler, Heun, DPM2 y RES Multistep, un Sigma Harvest consciente del muestreador y corrige el redimensionado de fotogramas clave I2V.

ComfyUI-MiniMax-H3-SPEED divide una ejecución de muestreo de MiniMax H3 entre varias resoluciones: los primeros pasos, los más ruidosos, se ejecutan sobre una cuadrícula de baja resolución y económica, y la cuadrícula se escala a medida que empiezan a importar los detalles más finos. La versión 2 elimina la restricción de usar solo Euler, hace que la calibración tenga en cuenta el muestreador y corrige el redimensionado de fotogramas clave que hacía que las ejecuciones de imagen a vídeo salieran más borrosas tras cada transición.
Tres fotogramas del mismo clip: referencia a resolución completa, 3 etapas y 4 etapas

Misma semilla y prompt, 960x544 a 24 fps, 10.125 s. Izquierda: referencia a resolución completa, sin SPEED (571.49 s). Centro: 3 etapas con delta 0.005 (438.85 s). Derecha: 4 etapas con delta 0.05 (237.57 s).

Cómo SPEED divide el schedule

MiniMax H3 paga el coste espacial completo en cada paso de denoising, incluidos los primeros, donde el latent está dominado por el ruido y todavía no existe detalle de alta frecuencia. SPEED traslada esos pasos a una cuadrícula más pequeña y luego vuelve a subir: el muestreador hace denoising a una fracción de la resolución objetivo y después transfiere el latent a una cuadrícula mayor para los pasos restantes.

El nodo incluye tres escaleras automáticas, seleccionadas mediante un único valor stages:

stagesEscalera de resolución
20.5 a 1.0
30.33 a 0.66 a 1.0
40.25 a 0.5 a 0.75 a 1.0

Tolerance (Delta), noise_amplitude y noise_decay_exponent deciden cuándo ocurre cada transición; los valores por defecto incluidos provienen del propio ajuste de calibración del autor, y el README recomienda no tocarlos salvo que estés ejecutando una calibración Harvest. Las bandas de alta frecuencia que expone un aumento de resolución se rellenan a partir de un campo gaussiano determinista, sembrado por la transición, bajo la política de ruido predeterminada direct_coarse. Una segunda política, coupled_full_grid, deriva esas bandas de un único campo de ruido a resolución completa; el autor no ha confirmado que mejore la calidad y no es la predeterminada.

SPEED se aplica únicamente a MiniMax H3, y el flujo de audio de H3 siempre permanece a resolución completa.

Qué cambió en la V2

El CHANGELOG.md del repositorio lo lista como 2.0.0. Los cambios sustanciales:

  • Soporte de muestreadores. SPEED ya no está atado a Euler. La V2 acepta Euler, Heun, DPM2, Exp Heun 2 X0 y RES Multistep. Los muestreadores sin estado usan los propios objetos sampler de ComfyUI; RES Multistep conserva el historial del paso anterior, así que la V2 lo ejecuta mediante un adaptador con ámbito de ejecución y borra ese estado cada vez que SPEED cambia de resolución, en lugar de arrastrar el historial a un latent de tamaño distinto.
  • Sigma Harvest consciente del muestreador. El nodo de calibración ahora informa de los parámetros del muestreador que realmente seleccionaste, en lugar de asumir Euler, y usa por defecto la misma tolerancia de 0.005 que la ruta automática.
  • Planificación unificada. Los modos Automático y Manual comparten una única implementación de planificación y validación. El modo Automático ahora calcula las transiciones a partir del schedule de sigmas activo y de las dimensiones actuales del latent.
  • Corrección de fotogramas clave en I2V. Los latents de los fotogramas clave se redimensionan desde su copia original a resolución completa, en lugar de redimensionar un tensor ya redimensionado, y se restauran antes de la etapa final y después de una ejecución fallida. El resumen del autor: la imagen a vídeo ya no debería volverse progresivamente más borrosa en cada cambio de resolución.
  • Memoria de Harvest más ligera. La V1 conservaba todos los tensores residuales a resolución completa hasta que la ejecución finalizaba y los analizaba después. La V2 reduce cada residual a un pequeño perfil de potencia DCT radial dentro del callback y descarta el tensor.
  • Progreso y vistas previas continuos. Una ejecución de SPEED ahora se informa como una sola generación en lugar de como varias llamadas a muestreadores sin relación entre sí.
  • Cobertura de regresión ampliada en selección de muestreadores, estado de RES, I2V, transiciones, Harvest, flujos de trabajo y políticas de ruido.

Aceleraciones medidas

El repositorio publica una carpeta de evidencias con los tiempos que respaldan las afirmaciones: una RTX 5080 con 128 GB de RAM del sistema, salida de 960x544 a 24 fps durante 10.125 segundos, misma semilla y prompt en todas las filas. La referencia de Euler a resolución completa es de 571.49 s.

Tolerance (Delta)2 etapas3 etapas4 etapas
0.005462.96 s (1.23x)438.85 s (1.30x)435.21 s (1.31x)
0.010450.38 s (1.27x)409.83 s (1.39x)384.13 s (1.49x)
0.050278.44 s (2.05x)262.32 s (2.18x)237.57 s (2.41x)

La misma carpeta señala con claridad los límites de esas cifras. Son un conjunto de referencia solo para Euler: no establecen paridad de velocidad ni de calidad para los cuatro muestreadores que añadió la V2, y no deben interpretarse como prueba de que una política de ruido sea mejor que otra. La indicación del autor es volver a ejecutar la calibración Harvest y hacer un benchmark de tu propia combinación de muestreador, modelo y scheduler.

Los tres nodos

NodoQué hace
Nodo principal SPEED (Automático)Elige la escalera de 2, 3 o 4 etapas y gestiona las transiciones a partir del schedule de sigmas activo
SPEED Sampler (Step-Through, Manual)Hasta cuatro pares explícitos (goal, resolution); ratio_mode trata un objetivo como un índice de paso global (steps) o como una fracción de 0 a 1 del schedule (ratio). Las resoluciones activas deben aumentar y la última debe ser 1.0
Sigma HarvestSe ejecuta con tu flujo de trabajo existente para medir el muestreador que pretendes usar, y devuelve los valores sampler_name, delta, noise_amplitude y noise_decay_exponent que debes copiar en el nodo correspondiente

La instalación consiste en clonar el paquete en ComfyUI/custom_nodes/ y reiniciar. En un flujo de trabajo, sustituye SamplerCustomAdvanced por el nodo muestreador de SPEED y conecta las mismas entradas noise, guider, sigmas y latent_image; un KSampler todo en uno tiene que dividirse primero en los componentes de muestreo avanzado de ComfyUI.

Flujos de trabajo

El repositorio incluye tres flujos de trabajo en formato de frontend. La variante calculada ejecuta Sigma Harvest dentro del gráfico, de modo que los valores de calibración llegan automáticamente; la variante manual expone la escalera para ajustarla a mano.

El flujo de trabajo calculado envuelve un gráfico H3 de imagen a vídeo en un subgráfico y configura el muestreador SPEED con stages = 3, direct_coarse, delta = 0.005, noise_amplitude = 12.105, noise_decay_exponent = 0.773, seed_offset = 10000 y sampler = euler. Sus notas apuntan al checkpoint fl2va convrot int8 podado, al codificador de texto nvfp4 Qwen3-VL 32B y a los VAE separados de vídeo y audio de H3.

Disponibilidad

El repositorio había acumulado 85 estrellas cuando se escribió esto. El hilo del anuncio se publicó en r/comfyui, y buena parte de la discusión pedía salidas comparadas en paralelo en lugar de la tabla de tiempos; el autor remitió a los lectores a la carpeta de evidencias y a una comparativa de velocidad independiente de terceros. No se había publicado ninguna reproducción independiente del conjunto de muestreadores de la V2 en el momento de escribir esto.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
ComfyUI MiniMax H3 SPEED V2: resolución progresiva multi-muestreador | ComfyUI Wiki