Qwen3-VL: Codificador de Texto de Visión-Lenguaje

ComfyUI Wiki

Qwen3-VL es el último modelo de visión-lenguaje de Alibaba para usar como codificador de texto en ComfyUI, disponible en variantes 4B y 8B con cuantización bf16, fp8 y nvfp4.

Q

Qwen3-VL

Vision-LanguageText EncoderOCRAgentOpen Source

Último modelo de visión-lenguaje de la serie Qwen (Alibaba Cloud). Ofrece mejoras integrales en comprensión de texto, percepción visual, contexto extendido (256K nativo, expandible a 1M) e interacción con agentes. Empaquetado como checkpoints de codificador de texto para ComfyUI en tamaños 4B y 8B con opciones de cuantización bf16, fp8 escalado y nvfp4.

DesarrolladorAlibaba Cloud (Equipo Qwen)
Fecha de publicación2025-07
ArquitecturaTransformer de Visión-Lenguaje Denso y MoE
LicenciaApache-2.0
Variantes4B (Denso), 8B (Denso)
Ventana de contexto256K nativo (expandible a 1M)
CuantizacionesBF16, FP8 escalado, NVFP4 (solo 8B)
CapacidadesAgente visual, OCR (32 idiomas), codificación visual, percepción espacial, comprensión de videos largos

Guides and workflows related to this model series.

No articles found.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…