ComfyUI-MiniMaxH3-CLIPCached: cache en disco para H3
Nuevo nodo de ComfyUI que cachea en disco el condicionamiento Qwen3-VL de MiniMax H3: repite ejecuciones con el mismo prompt saltandose el encoder de 14,6 GB, de 29,9 s a 1,1 s.
El nodo con caché reemplaza al nodo de conditioning H3 estándar; la etapa de diffusion no se modifica.
Qué guarda en caché y qué no
No es un acelerador de muestreo. No es TeaCache ni FirstBlockCache y deja intactos los pasos de muestreo. El nodo reemplaza al nodo de conditioning H3 estándar de ComfyUI: cuando hay un acierto de caché, carga desde el disco el conditioning de texto/visión ya calculado en lugar de ejecutar el codificador Qwen3-VL, y la etapa de diffusion continúa sin cambios.
| Cambio | ¿Nueva entrada de caché? |
|---|---|
| Texto del prompt | Sí |
| Checkpoint del codificador | Sí |
| Fotogramas clave o píxeles de referencia visibles para el codificador | Sí, cuando cambia el contenido que ve el codificador |
| Semilla, sampler, scheduler y pasos | No |
| LoRA posterior o su intensidad | No |
Esa división es relevante para los flujos de trabajo iterativos: si vuelves a ejecutar el mismo prompt ajustando solo la configuración del sampler o los pesos de LoRA, cualquier ejecución posterior a la primera será un acierto de caché.
Mediciones
El benchmark controlado del autor (5 casos por modo, medianas, RTX 5080 de 16 GB en WSL2 y lecturas del codificador deliberadamente en frío en los modos nativo y de fallo) arroja los siguientes resultados:
| Modo | Conditioning | Pico de VRAM | Pico de RAM del proceso |
|---|---|---|---|
| Nativo | 29.85 s | 15.24 GiB | 29.25 GiB |
| Fallo de caché | 32.23 s | 15.24 GiB | 28.25 GiB |
| Acierto de caché | 1.12 s | 2.67 GiB | 3.38 GiB |
Un fallo no es, deliberadamente, una vía rápida: aun así ejecuta el codificador y escribe el resultado en el disco, lo que cuesta unos 2 segundos extra. Pero, después de la codificación, el codificador se descarga en lugar de permanecer residente, por lo que el muestreo se ejecuta con esa memoria liberada. En la captura de pantalla del autor, el modo nativo mantiene residentes durante el muestreo tanto el modelo H3 de 11.7 GB como el codificador de 14.6 GB, mientras que un acierto de caché deja únicamente el DiT cargado y reduce la RAM del proceso de 40 GB a 25.5 GB.
Nodos y gestión de la caché
El paquete incluye versiones con caché de los nodos H3 estándar Image-to-Video (FL2VA) y Reference-to-Video (Ref2VA), además de variantes de doble resolución que preparan el conditioning tanto para la pasada base como para un objetivo de upscale, y un selector compartido del nombre del codificador.
Cada solicitud de conditioning distinta genera una entrada de caché que se conserva hasta que se elimina, y las entradas se acumulan si iteras mucho. Un panel integrado de administración de caché permite explorarlas, etiquetarlas y podarlas. Los requisitos son ComfyUI 0.30.0 o posterior, con los nodos H3 nativos.
Disponibilidad
El nodo está en ComfyUI Manager y en el registro como minimaxh3-clipcached, o puedes clonar el repositorio en custom_nodes. La versión actual no implementa expulsión automática de caché, Ref2VA usa ranuras de referencia fijas y los codificadores GGUF no se han probado todavía.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.