LTX 2.3 Imagen: checkpoints solo imagen en ComfyUI

ComfyUI Wikinews

Nuevo PR de ComfyUI añade la ruta de modelo LTXV 2.3 solo imagen, con checkpoints 13B Dev y Distilled, muestreo de 8 pasos sin CFG y builds convrot int8.

LTX 2.3 ha sido hasta ahora un modelo de vídeo y audio, pero resulta que la misma arquitectura base genera un generador de imágenes estáticas capaz. Un nuevo pull request contra ComfyUI de elismasilva añade una ruta de modelo dedicada solo para imagen (ltxv_image) para los checkpoints de LTXV 2.3, y un repositorio complementario de Hugging Face incluye cuatro checkpoints safetensors unificados podados para texto a imagen.

LTX 2.3 open source

LTX 2.3: el modelo base de audio-vídeo del cual están podados los checkpoints solo de imagen

Qué añade el PR

El pull request enruta los checkpoints de LTXV 2.3 solo para imagen a través de un nuevo par LTXVImage / LTXVImageModel, seleccionado solo cuando los metadatos del checkpoint marcan el modelo como image_model="ltxv_image". La ruta de vídeo LTX existente permanece intacta y sigue instanciando el actual LTXVModel. Más allá del cargador, el PR también trae:

  • Atención gateada opcional en bloques transformadores LTXV (apagada por defecto).
  • Enrutamiento de perturbación STG por bloque para la auto-atención LTXV.
  • LTXVGuidanceRescale, un nuevo nodo que implementa el reescalado de orientación estilo Diffusers.
  • Dos planos: Texto a imagen (LTX-2.3 Imagen Dev) y Texto a imagen (LTX-2.3 Imagen Destilado), registrados bajo Generación y edición de imágenes/Texto a imagen.

El PR está abierto desde el 28 de agosto de 2026 y aún no se ha fusionado. Hasta que la ruta ltxv_image llegue al upstream, los checkpoints pueden probarse en la rama de ComfyUI del autor.

Los checkpoints

Los cuatro archivos en elismasilva/ltx2.3-image-comfyui se derivan de la familia LTX 2.3 de Lightricks, podados para eliminar las rutas de ejecución de vídeo y audio. No hay nuevo entrenamiento involucrado: los pesos se convierten en checkpoints unificados de ComfyUI y se colocan en models/checkpoints/.

ArchivoVariante
ltx-2.3-13b-image-dev.safetensorsDev, bf16
ltx-2.3-13b-image-distilled.safetensorsDestilado, bf16
ltx-2.3-13b-image-dev-convrot-int8.safetensorsDev, convrot int8 cuantizado
ltx-2.3-13b-image-distilled-convrot-int8.safetensorsDestilado, convrot int8 cuantizado

El nombre 13b se refiere al tamaño efectivo después de podar el paquete LTX 2.3 original más grande. Las compilaciones int8 convrot intercambian algo de fidelidad por un menor uso de VRAM.

Configuraciones sugeridas

La tarjeta del modelo da puntos de partida para cada variante:

DevDestilado
Pasos20 a 408
CFG3.0 a 5.01.0 (sin CFG)
Escala PAG~0.8 (opcional)~0.8 (opcional)
Reescalado de orientación~0.7 (opcional)~0.7 (opcional)

Ambos planos en el PR exponen el prompt, resolución, pasos, orientación y los controles de PAG/reescalado de orientación, por lo que las configuraciones anteriores se mapean directamente a los flujos de trabajo enviados.

Estos planos requieren la ruta de modelo ltxv_image del PR #15953 o la rama ltxv-image-only del autor. No cargarán en el ComfyUI upstream actual hasta que el PR se fusione.

Por qué una ruta de imagen para un modelo de vídeo

El LTX-2.3 de Lightricks es un modelo base de audio-vídeo conjunto, y la poda solo de imagen es la misma dirección que otras familias de vídeo han tomado: eliminar los pesos temporales y de audio, mantener el prior espacial, y obtienes un checkpoint rápido de texto a imagen que hereda la adherencia al prompt del modelo base. Para los usuarios de ComfyUI que ya ejecutan LTX 2.3 para vídeo, los checkpoints de imagen reutilizan el mismo codificador de texto y convenciones de carga, por lo que probar texto a imagen cuesta poco más que descargar un checkpoint. Si el PR se fusiona, LTX 2.3 cubriría tanto imágenes estáticas como vídeo dentro de ComfyUI principal sin paquetes de nodos adicionales.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
LTX 2.3 Imagen: checkpoints solo imagen en ComfyUI | ComfyUI Wiki