Ref2VA VSA: nodo de atención dispersa para referencia a vídeo en H3

ComfyUI Wikinews

Un nodo de ComfyUI trasplanta la puerta VSA de FastH3 a MiniMax H3 Ref2VA: los tokens de referencia siguen densos y solo se podan los mosaicos de vídeo.

Ref2VA VSA lleva la atención dispersa de vídeo a la ruta de referencia a vídeo de MiniMax H3. La atención dispersa fue lo que hizo rápido a FastH3 en texto a vídeo, pero se consideraba incompatible con el acondicionamiento por referencia hasta que este nodo trasplantó la puerta entrenada al modelo Ref2VA.

Por qué Ref2VA se mantuvo en el esquema denso

VSA (atención dispersa de vídeo) agrupa los tokens de vídeo en mosaicos espacio-temporales 3D y poda la mayoría de ellos en cada bloque, que es como los checkpoints FastH3 reducen el coste de cada pasada forward del transformer. La referencia a vídeo rompe esa disposición: Ref2VA antepone segmentos multimodales dinámicos, latents de la imagen de referencia, latents del audio de referencia y tokens del prompt, por delante de la secuencia de vídeo generada.

El mosaico ingenuo coloca tokens de distintas modalidades dentro del mismo mosaico, lo que corrompe las máscaras de acondicionamiento y rompe la identidad del personaje. Por eso, la generación H3 basada en referencias siguió usando la ruta de atención densa mientras que texto a vídeo pasó a kernels dispersos.

El parche de atención de dos niveles

Ref2VA VSA resuelve esto con una disposición de atención concebida a medida en lugar de un nuevo checkpoint:

  1. Prefijo exento de poda - el mapeador de geometría aísla los tokens de texto, imagen de referencia y audio de referencia en mosaicos puros por segmento que quedan exentos de la poda top-k. Los tokens de referencia permanecen totalmente densos, así que la adherencia a la identidad no se sacrifica a cambio de velocidad.
  2. Solo vídeo disperso - la poda top-k se aplica estrictamente a los mosaicos clave del vídeo generado.
  3. Trasplante de puerta - las 50 matrices de proyección to_gate_compress entrenadas del checkpoint FastH3 VSA se acoplan a los bloques H3 de Ref2VA, y luego el mismo kernel Sol/VSA de tile-64 se ejecuta sobre el modelo parcheado.
Imagen de referencia del personaje usada en las ejecuciones de comparación

La imagen de referencia utilizada en las ejecuciones de comparación del autor.

El autor publicó comparaciones con la misma semilla en una sola máquina, un prompt y una imagen de referencia a 1344x768. Ambas columnas usan la misma referencia de personaje:

Ref2VA VSA, 4 pasosVideo Delta Net, 8 pasos
Ref2VA VSA: 4 pasos, 75 % de dispersión de vídeo, ~2,2 veces más rápidoVideo Delta Net (VDN-H3): 8 pasos

Frente al esquema denso nativo de H3, el repositorio reporta una aceleración de aproximadamente 9x, y de unas 2,2x sobre la ruta de Video Delta Net, con 4 pasos frente a 8.

Cómo integrarlo en un flujo de trabajo

Resultado del autor con Ref2VA VSA en 4 pasos a 1344x768.

El nodo de parche se coloca entre el cargador del modelo y la cadena de muestreo:

UNETLoader (Ref2VA INT8)
   -> LoraLoaderModelOnly (turbo 4-step LoRA, strength 1.0)
   -> Ref2VAVSAGatePatch (fasth3_vsa_gate.safetensors, sparsity 0.75)
   -> MiniMaxH3SigmaShift (shift_video 12, shift_audio 3)
   -> BasicScheduler (steps 4) + BasicGuider -> SamplerCustomAdvanced (euler)

El nodo se distribuye bajo FastH3/VSA y recibe el modelo, un archivo safetensors de puerta desde models/loras/ y un valor de sparsity. La receta de 4 pasos del README utiliza una dispersión de 0,75 con el scheduler simple; la propia descripción del nodo sugiere empezar entre 0,50 y 0,70 y comparar con la misma semilla densa antes de subir más. Esa misma categoría también contiene FastH3 VSA-H3 Patch (tile64), el parche original de texto a vídeo, así que ambas rutas pueden compartir una misma instalación.

Flujo de trabajo

El repositorio también incluye ref2va_vsa_4step_with_preview.json para una pasada de vista previa más ligera en la UI y ref2va_vsa_4step_api.json para el formato API, además de tools/extract_vsa_gate.py para reconstruir fasth3_vsa_gate.safetensors a partir de un checkpoint FastH3 VSA si ya tienes uno en local.

Disponibilidad

Ref2VA VSA es un nodo personalizado con licencia Apache-2.0. Clona Kablex/ComfyUI-Ref2VA-VSA dentro de ComfyUI/custom_nodes, reinicia y busca los nodos bajo FastH3/VSA. Requiere una versión reciente de ComfyUI con soporte para H3 y comfy-kitchen con las primitivas CUDA Sol-Attention, ya que el propio kernel disperso proviene de ese paquete.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Ref2VA VSA: nodo de atención dispersa para referencia a vídeo en H3 | ComfyUI Wiki