LTX 2.3 Imagen: checkpoints solo imagen en ComfyUI
Nuevo PR de ComfyUI añade la ruta de modelo LTXV 2.3 solo imagen, con checkpoints 13B Dev y Distilled, muestreo de 8 pasos sin CFG y builds convrot int8.
LTX 2.3 ha sido hasta ahora un modelo de vídeo y audio, pero resulta que la misma arquitectura base genera un generador de imágenes estáticas capaz. Un nuevo pull request contra ComfyUI de elismasilva añade una ruta de modelo dedicada solo para imagen (ltxv_image) para los checkpoints de LTXV 2.3, y un repositorio complementario de Hugging Face incluye cuatro checkpoints safetensors unificados podados para texto a imagen.
LTX 2.3: el modelo base de audio-vídeo del cual están podados los checkpoints solo de imagen
Qué añade el PR
El pull request enruta los checkpoints de LTXV 2.3 solo para imagen a través de un nuevo par LTXVImage / LTXVImageModel, seleccionado solo cuando los metadatos del checkpoint marcan el modelo como image_model="ltxv_image". La ruta de vídeo LTX existente permanece intacta y sigue instanciando el actual LTXVModel. Más allá del cargador, el PR también trae:
- Atención gateada opcional en bloques transformadores LTXV (apagada por defecto).
- Enrutamiento de perturbación STG por bloque para la auto-atención LTXV.
LTXVGuidanceRescale, un nuevo nodo que implementa el reescalado de orientación estilo Diffusers.- Dos planos:
Texto a imagen (LTX-2.3 Imagen Dev)yTexto a imagen (LTX-2.3 Imagen Destilado), registrados bajoGeneración y edición de imágenes/Texto a imagen.
El PR está abierto desde el 28 de agosto de 2026 y aún no se ha fusionado. Hasta que la ruta ltxv_image llegue al upstream, los checkpoints pueden probarse en la rama de ComfyUI del autor.
Los checkpoints
Los cuatro archivos en elismasilva/ltx2.3-image-comfyui se derivan de la familia LTX 2.3 de Lightricks, podados para eliminar las rutas de ejecución de vídeo y audio. No hay nuevo entrenamiento involucrado: los pesos se convierten en checkpoints unificados de ComfyUI y se colocan en models/checkpoints/.
| Archivo | Variante |
|---|---|
ltx-2.3-13b-image-dev.safetensors | Dev, bf16 |
ltx-2.3-13b-image-distilled.safetensors | Destilado, bf16 |
ltx-2.3-13b-image-dev-convrot-int8.safetensors | Dev, convrot int8 cuantizado |
ltx-2.3-13b-image-distilled-convrot-int8.safetensors | Destilado, convrot int8 cuantizado |
El nombre 13b se refiere al tamaño efectivo después de podar el paquete LTX 2.3 original más grande. Las compilaciones int8 convrot intercambian algo de fidelidad por un menor uso de VRAM.
Configuraciones sugeridas
La tarjeta del modelo da puntos de partida para cada variante:
| Dev | Destilado | |
|---|---|---|
| Pasos | 20 a 40 | 8 |
| CFG | 3.0 a 5.0 | 1.0 (sin CFG) |
| Escala PAG | ~0.8 (opcional) | ~0.8 (opcional) |
| Reescalado de orientación | ~0.7 (opcional) | ~0.7 (opcional) |
Ambos planos en el PR exponen el prompt, resolución, pasos, orientación y los controles de PAG/reescalado de orientación, por lo que las configuraciones anteriores se mapean directamente a los flujos de trabajo enviados.
ltxv_image del PR #15953 o la rama ltxv-image-only del autor. No cargarán en el ComfyUI upstream actual hasta que el PR se fusione.
Por qué una ruta de imagen para un modelo de vídeo
El LTX-2.3 de Lightricks es un modelo base de audio-vídeo conjunto, y la poda solo de imagen es la misma dirección que otras familias de vídeo han tomado: eliminar los pesos temporales y de audio, mantener el prior espacial, y obtienes un checkpoint rápido de texto a imagen que hereda la adherencia al prompt del modelo base. Para los usuarios de ComfyUI que ya ejecutan LTX 2.3 para vídeo, los checkpoints de imagen reutilizan el mismo codificador de texto y convenciones de carga, por lo que probar texto a imagen cuesta poco más que descargar un checkpoint. Si el PR se fusiona, LTX 2.3 cubriría tanto imágenes estáticas como vídeo dentro de ComfyUI principal sin paquetes de nodos adicionales.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.