Descripción
Acelera la decodificación/codificación VAE aplicando kernels fusionados de Triton norm+SiLU y la disposición de convoluciones channels_last. Los VAE compatibles se detectan automáticamente:
- Wan 2.1/2.2 (incluyendo la variante Qwen-Image): RMSNorm, ~1.4×/1.15× de aceleración.
- KL imagen (Flux/Flux2, SDXL, SD1.5): GroupNorm, ~1.6–1.8× a 2048px.
- LTXV/LTX2 VAE de vídeo: PixelNorm; los bloques decodificadores condicionados por paso de tiempo reciben fusión solo de normalización.
Otras arquitecturas no son compatibles y se pasarán sin cambios. Este nodo aplica parches sobre un patcher clonado, por lo que las optimizaciones solo existen mientras este VAE esté cargado.
Entradas
| Nombre | Tipo | Por defecto | Descripción |
|---|---|---|---|
vae | VAE | – | El modelo VAE a parchear. |
fuse_norm_silu | BOOLEAN | true | Reemplaza cadenas norm+SiLU (RMSNorm para Wan, GroupNorm para KL VAE) con kernels fusionados de Triton (paso único, acumulación fp32). Requiere Triton. |
channels_last | BOOLEAN | true | Convierte los pesos de convolución al formato de memoria channels_last, eliminando las transposiciones de diseño de cuDNN alrededor de cada convolución. Requerido para que el kernel fusionado de GroupNorm se active en KL VAE. |
int8_conv | BOOLEAN | false | EXPERIMENTAL: ejecuta las convoluciones 3×3 del decodificador VAE sobre núcleos tensoriales int8 (4× la tasa de bf16 en Ada+). Pesos cuantizados por canal de salida, activaciones dinámicamente por tensor; ~45–48 dB frente a decodificación bf16, posible pérdida menor de calidad. Compatible con Wan 2.1/2.2 y KL VAE de imagen (Flux2/SDXL/SD1.5); ignorado para otros. |
autotune | BOOLEAN | false | Compara varias configuraciones de tamaño de bloque de kernel en el primer uso de cada forma tensorial y almacena en caché la más rápida. Breve tartamudeo por cada nueva resolución, normalmente algunos puntos porcentuales más rápido después del calentamiento. |
Salidas
| Tipo | Descripción |
|---|---|
VAE | El objeto VAE parcheado (un patcher clonado). Usa esta salida en lugar de la conexión VAE original. |
Notas de uso
- Todas las optimizaciones requieren Triton instalado en tu entorno de ComfyUI (normalmente mediante
pip install triton). Sin Triton,fuse_norm_silueint8_convse omitirán silenciosamente. - Este nodo detecta automáticamente las arquitecturas VAE compatibles; los VAE no compatibles se reenvían sin modificar.
- Activa
autotunedespués de haber decidido tus resoluciones típicas para obtener la mejor velocidad a largo plazo, pero ten en cuenta el tartamudeo inicial en formas nuevas. - La opción
int8_conves experimental: verifica la calidad de tu salida antes de usarla en producción. - Dado que el VAE se parchea mediante un patcher clonado, el nodo VAE original en tu flujo de trabajo no se modifica. Debes enrutar la salida de este nodo a los nodos de decodificación/codificación.
- Este nodo se encuentra en la categoría KJNodes/experimental del menú de nodos.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.