Modelos y descargas para ComfyUI
Descubre y descarga modelos compatibles con los nodos nativos y personalizados de ComfyUI, o encuentra los modelos que necesitan tus flujos de trabajo.
Explora familias de modelos. Abre una tarjeta para versiones, descargas y docs.
Ovi: Generación de audio y video con doble backbone por Character.AI
Ovi de Character.AI es un modelo de generación de audio y video con doble backbone basado en Wan2.2. Genera audio y video sincronizados bidireccionalmente con condicionamiento MMAUDIO.
SkyReels-V2: Modelo Generativo de Cine de Longitud Infinita por Skywork
SkyReels-V2 es el primer modelo generativo de cine de longitud infinita de código abierto que utiliza Diffusion Forcing. Construido sobre Wan2.1, soporta T2V, I2V y generación de video autorregresiva.

Anima: Modelo de texto a imagen anime de 2 mil millones de parámetros de Circlestone Labs
Anima es un modelo de texto a imagen de 2 mil millones de parámetros creado por Circlestone Labs y Comfy Org, centrado en conceptos anime y estilos artísticos. Disponible en variantes Base, Aesthetic y Turbo para ComfyUI.
Familia Qwen: Modelos de Codificador de Texto de Código Abierto
Modelos de codificador de texto Qwen de Alibaba para usar con ComfyUI: Qwen3-VL (visión-lenguaje) y Qwen3.5 (solo texto).
Familia Z-Image: Modelos S3-DiT de 6B de Tongyi-MAI (Alibaba)
Z-Image es una familia de modelos eficientes de generación de imágenes de Tongyi-MAI (Alibaba). Cuenta con una arquitectura DiT de flujo único de 6 mil millones de parámetros con variantes para calidad (Z-Image) y velocidad (Z-Image-Turbo).
Familia VOID: Eliminación de objetos e interacciones en video por Netflix — Apache-2.0
VOID de Netflix es un modelo de eliminación de objetos e interacciones en vídeo que elimina objetos de los vídeos junto con todas las interacciones físicas inducidas.
Stable Audio: Modelos de texto a audio de código abierto
Stable Audio es la familia de modelos de texto a audio de Stability AI para generación de música, efectos de sonido y foley, incluyendo Stable Audio Open 1.0 y Stable Audio 3.
Familia Qwen-Image: Generación de imágenes de código abierto de Alibaba para ComfyUI
Qwen-Image es el modelo fundamental de generación de imágenes de código abierto de Alibaba en la serie Qwen, destacando en renderizado complejo de texto y edición precisa de imágenes.
Familia PixelDiT: DiT de espacio de píxeles sin VAE + Superresolución PiD de NVIDIA
PixelDiT de NVIDIA es un transformador de difusión de píxeles sin VAE para generación de texto a imagen. Incluye modelos PiD (Pixel Diffusion Decoder) para superresolución hasta 4K.
Familia Ovis: Modelos de generación de imágenes visión-lenguaje para ComfyUI
Ovis es la serie de modelos de generación de imágenes visión-lenguaje de AIDC-AI para usar con ComfyUI, que incluye modelos de difusión y codificadores de texto.
OmniGen: Modelo unificado de generación multimodal para ComfyUI
OmniGen es una serie de modelos unificados de generación multimodal de VectorSpace Lab que admite T2I, edición de imágenes y generación en contexto.
NewBie-image: generación de texto a imagen anime para ComfyUI
NewBie-image Exp0.1 es un modelo Next-DiT de 3.5B del NewBie AI Lab especializado en generación de imágenes de estilo anime.
Familia Lumina: Generación de imágenes basada en flujo para ComfyUI
Lumina-Image 2.0 de Alpha-VLLM es un transformer de difusión basado en flujo de 2 mil millones de parámetros para generación de texto a imagen.
Familia LongCat: Generación de imágenes bilingüe para ComfyUI
LongCat de Meituan es un modelo fundacional bilingüe (chino-inglés) de código abierto pionero para generación de imágenes con renderizado de texto chino superior y fotorrealismo.
Familia Krea: Modelo de Transformer de Difusión de código abierto con variantes Raw + Turbo
Krea 2 es un modelo de generación de imágenes AI de código abierto de Krea. Ofrece variantes Raw (calidad completa) y Turbo (destilado) con LoRAs de estilo para efectos artísticos diversos.
Familia Ideogram: Transformer de Difusión con tipografía superior de Ideogram AI
Ideogram 4 es un modelo de IA de texto a imagen de última generación de Ideogram AI. Cuenta con capacidades avanzadas de tipografía y generación fotorrealista.
Familia Gemma: Modelos de codificador de texto abiertos de Google para ComfyUI
Gemma es la familia de modelos abiertos de Google DeepMind para usar como codificadores de texto en ComfyUI, incluyendo Gemma 4 con variantes ajustadas por instrucciones E2B y E4B.
ERNIE-Image: Generación de Imágenes Open Source de Baidu de 8B — Apache-2.0
ERNIE-Image es la serie de modelos open source de generación de texto a imagen de 8B parámetros de Baidu, con un Prompt Enhancer ligero, destacando en renderizado de texto y generación estructurada.
Chroma: modelos de código abierto de texto a imagen y escalado para ComfyUI
Chroma es una serie de modelos de lodestones que incluye Chroma1-HD (8.9B T2I) y Chroma1-Radiance (escalado de alta resolución en desarrollo), ambos bajo licencia Apache 2.0.
Boogu-Image: Generación de Imágenes de Código Abierto para ComfyUI
Boogu-Image es una serie versátil de modelos de generación de imágenes con variantes base, turbo y edición para ComfyUI.
Wan Video Family: Generación de video AI open-source
La serie de modelos de generación de video open-source de Alibaba Cloud. Desde Wan2.1 hasta Wan2.2, ofreciendo generación de texto a video e imagen a video de alta calidad con arquitectura MoE.
Familia de modelos Stable Diffusion: SD 1.5, SDXL, SD 3.5 para ComfyUI
Linaje de Stable Diffusion de Stability AI: SD 1.5 (Runway), SD 2.x, SDXL y SD 3.5. Checkpoints abiertos de texto a imagen muy utilizados en ComfyUI.
LTX Video: Modelo de Generación de Video en Tiempo Real
LTX-Video es el primer modelo de generación de video basado en DiT de Lightricks con 2B parámetros, compatible con generación de texto a video y de imagen a video.
DeepSeek Janus: Modelo de IA multimodal para ComfyUI
DeepSeek Janus Pro es un modelo de IA multimodal capaz de comprender y generar imágenes, publicado como código abierto por DeepSeek en enero de 2025.
IC-Light: Modelo de reiluminación de imágenes con IA para ComfyUI
IC-Light es una serie de modelos de reiluminación de imágenes creada por lllyasviel. La introduce condicionamiento de primer plano para una reiluminación de imágenes de calidad profesional.
Hunyuan3D: generación de modelos 3D de código abierto
Hunyuan3D es la serie de modelos de generación 3D de código abierto de Tencent. La versión 2.0 admite la generación de modelos 3D de alta fidelidad con mapas de textura de alta resolución a partir de entradas de texto, imagen o boceto.
Familia Hunyuan Video: Generación de vídeo open-source de Tencent
Serie de modelos de generación de vídeo open-source de Tencent. De v1.0 a v1.5, generación de texto a vídeo e imagen a vídeo de alta calidad.
HiDream-I1: Modelo de texto a imagen de código abierto con 17B parámetros
HiDream-I1 es un modelo de texto a imagen de 17B parámetros de HiDream-ai, que combina DiT con arquitectura MoE. Con licencia MIT, disponible en variantes Full/Dev/Fast.
Familia Flux: Modelos Open Source de Generación de Imágenes para ComfyUI
Flux es una serie de modelos de generación de imágenes open source de Black Forest Labs. Dos generaciones: FLUX.1 (3.8B DiT) y FLUX.2 (32B dense transformer).
ACE-Step: Guía del modelo de generación de música
ACE-Step es un modelo base de generación de música de código abierto desarrollado conjuntamente por StepFun y ACE Studio, compatible con generación musical, edición y síntesis de audio.