KJNodes/experimentalgenerated

Parche Triton VAE(PatchTritonVAE)

Acelera la decodificación/codificación VAE con kernels fusionados de Triton norm+SiLU y disposición de convoluciones channels_last. Los VAE compatibles se detectan automáticamente: Wan 2.1/2.2 (incl. Qwen-Image, RMSNorm, ~1.4×/1.15×), KL imagen (Flux/Flux2, SDXL y SD1.5, GroupNorm, ~1.6–1.8× a 2048px), y LTXV/LTX2 (PixelNorm; los bloques decodificadores condicionados por paso de tiempo reciben fusión solo de normalización). Otras arquitecturas no son compatibles. Se aplica como parches sobre un patcher clonado, por lo que solo existe mientras este VAE esté cargado.

Patch Triton VAE

vae
vae
fuse_norm_silu
channels_last
int8_conv
autotune
KJNodes

Descripción

Acelera la decodificación/codificación VAE aplicando kernels fusionados de Triton norm+SiLU y la disposición de convoluciones channels_last. Los VAE compatibles se detectan automáticamente:

  • Wan 2.1/2.2 (incluyendo la variante Qwen-Image): RMSNorm, ~1.4×/1.15× de aceleración.
  • KL imagen (Flux/Flux2, SDXL, SD1.5): GroupNorm, ~1.6–1.8× a 2048px.
  • LTXV/LTX2 VAE de vídeo: PixelNorm; los bloques decodificadores condicionados por paso de tiempo reciben fusión solo de normalización.

Otras arquitecturas no son compatibles y se pasarán sin cambios. Este nodo aplica parches sobre un patcher clonado, por lo que las optimizaciones solo existen mientras este VAE esté cargado.

Entradas

NombreTipoPor defectoDescripción
vaeVAEEl modelo VAE a parchear.
fuse_norm_siluBOOLEANtrueReemplaza cadenas norm+SiLU (RMSNorm para Wan, GroupNorm para KL VAE) con kernels fusionados de Triton (paso único, acumulación fp32). Requiere Triton.
channels_lastBOOLEANtrueConvierte los pesos de convolución al formato de memoria channels_last, eliminando las transposiciones de diseño de cuDNN alrededor de cada convolución. Requerido para que el kernel fusionado de GroupNorm se active en KL VAE.
int8_convBOOLEANfalseEXPERIMENTAL: ejecuta las convoluciones 3×3 del decodificador VAE sobre núcleos tensoriales int8 (4× la tasa de bf16 en Ada+). Pesos cuantizados por canal de salida, activaciones dinámicamente por tensor; ~45–48 dB frente a decodificación bf16, posible pérdida menor de calidad. Compatible con Wan 2.1/2.2 y KL VAE de imagen (Flux2/SDXL/SD1.5); ignorado para otros.
autotuneBOOLEANfalseCompara varias configuraciones de tamaño de bloque de kernel en el primer uso de cada forma tensorial y almacena en caché la más rápida. Breve tartamudeo por cada nueva resolución, normalmente algunos puntos porcentuales más rápido después del calentamiento.

Salidas

TipoDescripción
VAEEl objeto VAE parcheado (un patcher clonado). Usa esta salida en lugar de la conexión VAE original.

Notas de uso

  • Todas las optimizaciones requieren Triton instalado en tu entorno de ComfyUI (normalmente mediante pip install triton). Sin Triton, fuse_norm_silu e int8_conv se omitirán silenciosamente.
  • Este nodo detecta automáticamente las arquitecturas VAE compatibles; los VAE no compatibles se reenvían sin modificar.
  • Activa autotune después de haber decidido tus resoluciones típicas para obtener la mejor velocidad a largo plazo, pero ten en cuenta el tartamudeo inicial en formas nuevas.
  • La opción int8_conv es experimental: verifica la calidad de tu salida antes de usarla en producción.
  • Dado que el VAE se parchea mediante un patcher clonado, el nodo VAE original en tu flujo de trabajo no se modifica. Debes enrutar la salida de este nodo a los nodos de decodificación/codificación.
  • Este nodo se encuentra en la categoría KJNodes/experimental del menú de nodos.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…