Modelos y descargas para ComfyUI

Descubre y descarga modelos compatibles con los nodos nativos y personalizados de ComfyUI, o encuentra los modelos que necesitan tus flujos de trabajo.

Explora familias de modelos. Abre una tarjeta para versiones, descargas y docs.

AudioVídeo

Ovi: Generación de audio y video con doble backbone por Character.AI

Ovi de Character.AI es un modelo de generación de audio y video con doble backbone basado en Wan2.2. Genera audio y video sincronizados bidireccionalmente con condicionamiento MMAUDIO.

0 páginas de versión4
Texto a imagen

SkyReels-V2: Modelo Generativo de Cine de Longitud Infinita por Skywork

SkyReels-V2 es el primer modelo generativo de cine de longitud infinita de código abierto que utiliza Diffusion Forcing. Construido sobre Wan2.1, soporta T2V, I2V y generación de video autorregresiva.

0 páginas de versión0
Texto a imagen

Anima: Modelo de texto a imagen anime de 2 mil millones de parámetros de Circlestone Labs

Anima es un modelo de texto a imagen de 2 mil millones de parámetros creado por Circlestone Labs y Comfy Org, centrado en conceptos anime y estilos artísticos. Disponible en variantes Base, Aesthetic y Turbo para ComfyUI.

0 páginas de versión5
Texto a imagen

Familia Qwen: Modelos de Codificador de Texto de Código Abierto

Modelos de codificador de texto Qwen de Alibaba para usar con ComfyUI: Qwen3-VL (visión-lenguaje) y Qwen3.5 (solo texto).

2 páginas de versión2
Texto a imagen

Familia Z-Image: Modelos S3-DiT de 6B de Tongyi-MAI (Alibaba)

Z-Image es una familia de modelos eficientes de generación de imágenes de Tongyi-MAI (Alibaba). Cuenta con una arquitectura DiT de flujo único de 6 mil millones de parámetros con variantes para calidad (Z-Image) y velocidad (Z-Image-Turbo).

2 páginas de versión4
Vídeo

Familia VOID: Eliminación de objetos e interacciones en video por Netflix — Apache-2.0

VOID de Netflix es un modelo de eliminación de objetos e interacciones en vídeo que elimina objetos de los vídeos junto con todas las interacciones físicas inducidas.

1 páginas de versión1
Audio

Stable Audio: Modelos de texto a audio de código abierto

Stable Audio es la familia de modelos de texto a audio de Stability AI para generación de música, efectos de sonido y foley, incluyendo Stable Audio Open 1.0 y Stable Audio 3.

2 páginas de versión3
Edición de imagen

Familia Qwen-Image: Generación de imágenes de código abierto de Alibaba para ComfyUI

Qwen-Image es el modelo fundamental de generación de imágenes de código abierto de Alibaba en la serie Qwen, destacando en renderizado complejo de texto y edición precisa de imágenes.

3 páginas de versión4
Texto a imagen

Familia PixelDiT: DiT de espacio de píxeles sin VAE + Superresolución PiD de NVIDIA

PixelDiT de NVIDIA es un transformador de difusión de píxeles sin VAE para generación de texto a imagen. Incluye modelos PiD (Pixel Diffusion Decoder) para superresolución hasta 4K.

1 páginas de versión1
Texto a imagen

Familia Ovis: Modelos de generación de imágenes visión-lenguaje para ComfyUI

Ovis es la serie de modelos de generación de imágenes visión-lenguaje de AIDC-AI para usar con ComfyUI, que incluye modelos de difusión y codificadores de texto.

1 páginas de versión3
Multimodal

OmniGen: Modelo unificado de generación multimodal para ComfyUI

OmniGen es una serie de modelos unificados de generación multimodal de VectorSpace Lab que admite T2I, edición de imágenes y generación en contexto.

1 páginas de versión0
Texto a imagen

NewBie-image: generación de texto a imagen anime para ComfyUI

NewBie-image Exp0.1 es un modelo Next-DiT de 3.5B del NewBie AI Lab especializado en generación de imágenes de estilo anime.

1 páginas de versión0
Texto a imagen

Familia Lumina: Generación de imágenes basada en flujo para ComfyUI

Lumina-Image 2.0 de Alpha-VLLM es un transformer de difusión basado en flujo de 2 mil millones de parámetros para generación de texto a imagen.

1 páginas de versión2
Edición de imagen

Familia LongCat: Generación de imágenes bilingüe para ComfyUI

LongCat de Meituan es un modelo fundacional bilingüe (chino-inglés) de código abierto pionero para generación de imágenes con renderizado de texto chino superior y fotorrealismo.

2 páginas de versión1
Texto a imagen

Familia Krea: Modelo de Transformer de Difusión de código abierto con variantes Raw + Turbo

Krea 2 es un modelo de generación de imágenes AI de código abierto de Krea. Ofrece variantes Raw (calidad completa) y Turbo (destilado) con LoRAs de estilo para efectos artísticos diversos.

1 páginas de versión3
Texto a imagen

Familia Ideogram: Transformer de Difusión con tipografía superior de Ideogram AI

Ideogram 4 es un modelo de IA de texto a imagen de última generación de Ideogram AI. Cuenta con capacidades avanzadas de tipografía y generación fotorrealista.

1 páginas de versión1
Texto a imagen

Familia Gemma: Modelos de codificador de texto abiertos de Google para ComfyUI

Gemma es la familia de modelos abiertos de Google DeepMind para usar como codificadores de texto en ComfyUI, incluyendo Gemma 4 con variantes ajustadas por instrucciones E2B y E4B.

1 páginas de versión2
Texto a imagen

ERNIE-Image: Generación de Imágenes Open Source de Baidu de 8B — Apache-2.0

ERNIE-Image es la serie de modelos open source de generación de texto a imagen de 8B parámetros de Baidu, con un Prompt Enhancer ligero, destacando en renderizado de texto y generación estructurada.

1 páginas de versión2
Texto a imagen

Chroma: modelos de código abierto de texto a imagen y escalado para ComfyUI

Chroma es una serie de modelos de lodestones que incluye Chroma1-HD (8.9B T2I) y Chroma1-Radiance (escalado de alta resolución en desarrollo), ambos bajo licencia Apache 2.0.

2 páginas de versión1
Edición de imagen

Boogu-Image: Generación de Imágenes de Código Abierto para ComfyUI

Boogu-Image es una serie versátil de modelos de generación de imágenes con variantes base, turbo y edición para ComfyUI.

2 páginas de versión4
AudioVídeoEdición de imagen

Wan Video Family: Generación de video AI open-source

La serie de modelos de generación de video open-source de Alibaba Cloud. Desde Wan2.1 hasta Wan2.2, ofreciendo generación de texto a video e imagen a video de alta calidad con arquitectura MoE.

23 páginas de versión2
VídeoTexto a imagen

Familia de modelos Stable Diffusion: SD 1.5, SDXL, SD 3.5 para ComfyUI

Linaje de Stable Diffusion de Stability AI: SD 1.5 (Runway), SD 2.x, SDXL y SD 3.5. Checkpoints abiertos de texto a imagen muy utilizados en ComfyUI.

7 páginas de versión2
AudioVídeo

LTX Video: Modelo de Generación de Video en Tiempo Real

LTX-Video es el primer modelo de generación de video basado en DiT de Lightricks con 2B parámetros, compatible con generación de texto a video y de imagen a video.

3 páginas de versión2
Multimodal

DeepSeek Janus: Modelo de IA multimodal para ComfyUI

DeepSeek Janus Pro es un modelo de IA multimodal capaz de comprender y generar imágenes, publicado como código abierto por DeepSeek en enero de 2025.

1 páginas de versión2
Texto a imagen

IC-Light: Modelo de reiluminación de imágenes con IA para ComfyUI

IC-Light es una serie de modelos de reiluminación de imágenes creada por lllyasviel. La introduce condicionamiento de primer plano para una reiluminación de imágenes de calidad profesional.

0 páginas de versión1
Modelo 3D

Hunyuan3D: generación de modelos 3D de código abierto

Hunyuan3D es la serie de modelos de generación 3D de código abierto de Tencent. La versión 2.0 admite la generación de modelos 3D de alta fidelidad con mapas de textura de alta resolución a partir de entradas de texto, imagen o boceto.

2 páginas de versión2
Vídeo

Familia Hunyuan Video: Generación de vídeo open-source de Tencent

Serie de modelos de generación de vídeo open-source de Tencent. De v1.0 a v1.5, generación de texto a vídeo e imagen a vídeo de alta calidad.

2 páginas de versión2
Texto a imagen

HiDream-I1: Modelo de texto a imagen de código abierto con 17B parámetros

HiDream-I1 es un modelo de texto a imagen de 17B parámetros de HiDream-ai, que combina DiT con arquitectura MoE. Con licencia MIT, disponible en variantes Full/Dev/Fast.

2 páginas de versión0
Texto a imagen

Familia Flux: Modelos Open Source de Generación de Imágenes para ComfyUI

Flux es una serie de modelos de generación de imágenes open source de Black Forest Labs. Dos generaciones: FLUX.1 (3.8B DiT) y FLUX.2 (32B dense transformer).

5 páginas de versión6
Audio

ACE-Step: Guía del modelo de generación de música

ACE-Step es un modelo base de generación de música de código abierto desarrollado conjuntamente por StepFun y ACE Studio, compatible con generación musical, edición y síntesis de audio.

2 páginas de versión1