ComfyUI v0.37.0: Qwen-Image 2.1 y soporte para MoGe 3
ComfyUI v0.37.0 añade soporte nativo de Qwen-Image 2.1 con tres plantillas oficiales, estimación de geometría MoGe 3, codificadores Qwen3.8 más rápidos y carga rápida desde disco.
MoGe 3 refina un mapa de puntos tosco sobre una capa de vóxeles dispersa, conservando las estructuras delgadas que los decodificadores en espacio de imagen difuminan (comparación de Comfy-Org/ComfyUI#16381).
Qwen-Image 2.1 en el núcleo
Qwen-Image 2.1 llegó al núcleo a través de Comfy-Org/ComfyUI#16400 (CORE-423) y se distribuye como una implementación nativa: el transformer de difusión de flujo único de 7B vive en comfy/ldm/qwen_image21, con el codificador de texto Qwen3-VL-8B leído desde su último estado oculto y las ranuras de imagen de referencia empalmadas por el propio DiT.
Dos nodos nuevos cubren el lado de edición del modelo:
- Codificar texto Qwen Image 2.1 (
TextEncodeQwenImage21, categoríamodel/conditioning/qwen image) acepta una lista dinámica de imágenes de referencia en lugar de una entrada fija, las redimensiona con el widgetresolution(predeterminado 1024, múltiplos de 32,0mantiene cada referencia en su propio tamaño) y las empalma en la secuencia como latentes VAE. Produce acondicionamiento positivo y negativo, además de un latente vacío dimensionado según la primera imagen de referencia, que es lo que mantiene alineada una edición. - Caché Qwen Image 2.1 (
QwenImage21Cache) define dónde vive la caché KV de prefijo y cómo se almacena:deviceesauto,gpu,cpuuoff, ydtypeesdefault,int8oint4.cpuprecarga la caché desde la RAM por detrás del cómputo, mientras queoffrecalcula el prefijo en cada paso, lo que es más lento pero descarta la caché al depurar.
La versión incluye tres plantillas oficiales: texto a imagen, edición de imagen y eliminación de fondo. Las tres requieren v0.37.0 o una versión posterior.
Salida de la plantilla oficial de edición de imagen de Qwen Image 2.1, del repositorio workflow_templates.
Los pesos reempaquetados se publican como Comfy-Org/Qwen-Image-2.1.
MoGe 3: estimación de geometría de detalle fino
MoGe 3 es la tercera generación del modelo de geometría monocular de Microsoft Research, publicado en el artículo MoGe-3: Fine-Detail Monocular Geometry Estimation with Self-Guided Sparse Volumetric Refinement. En lugar de decodificar un mapa de puntos directamente en el espacio de imagen, eleva la predicción tosca a una capa de vóxeles dispersa y ejecuta sobre ella una UNet 3D dispersa, que es lo que mantiene nítidas las estructuras delgadas y las discontinuidades de profundidad.
El soporte en el núcleo llegó en Comfy-Org/ComfyUI#16381 (CORE-443) para ambos checkpoints, ViT-L y ViT-G. El port de ComfyUI construye el refinador sobre los kernels dispersos FlexGEMM que el proyecto ya incluye para Trellis 2 (comfy/ldm/trellis2/flexgemm.py), así que no hay que instalar nada extra en una configuración CUDA normal.
Teaser de la página del proyecto MoGe 3.
La plantilla oficial utility_moge3_geometry_estimation toma una imagen y genera un mapa de profundidad y un mapa de normales de superficie. Carga moge_3_vitg_fp16.safetensors de forma predeterminada, y el archivo ViT-L se puede seleccionar en el mismo menú desplegable. El nuevo widget refine_steps en Inferencia MoGe e Inferencia panorámica MoGe controla directamente el refinador de MoGe-3: valor predeterminado 3, hasta 8, y 0 lo desactiva. No tiene efecto en los checkpoints de MoGe 1 o MoGe 2, que los nodos siguen cargando.
La plantilla se ejecuta a partir de una sola imagen (recurso de entrada del repositorio workflow_templates).
La plantilla espera los pesos reempaquetados de Comfy-Org/MoGe:
📂 ComfyUI/
└── 📂 models/
└── 📂 geometry_estimation/
├── moge_1_vitl_fp16.safetensors
├── moge_2_vitl_normal_fp16.safetensors
├── moge_3_vitg_fp16.safetensors
└── moge_3_vitl_fp16.safetensorsLa misma familia de nodos conserva las herramientas anteriores: inferencia panorámica que divide una imagen equirectangular en doce vistas en perspectiva y vuelve a fusionar la profundidad, conversión de mapa de puntos a malla y una lectura de FoV para el emparejamiento de cámara.
Codificadores de texto Qwen más rápidos
Comfy-Org/ComfyUI#15623 (CORE-390) es una pasada de velocidad de decodificación sobre los codificadores de texto Qwen3.5 y Qwen3.8, que importan para la reescritura de prompts de Qwen-Image y para los nodos de generación de texto:
- Decodificación especulativa: la cabeza de predicción multi-token del checkpoint redacta de 2 a 5 tokens y una pasada de verificación por lotes los acepta. La cabeza de redacción se ejecuta como un grafo CUDA capturado y la pasada de verificación se ejecuta bajo el compilador de memoria.
- FixedKVBias: una caché de atención de capacidad completa con una posición de escritura en el lado del dispositivo, para que los pasos de decodificación sigan siendo reproducibles como grafo en
llama.pyyqwen35.py. - Kernels fusionados de decodificación DeltaNet de comfy-kitchen, con una alternativa en modo eager, además de penalizaciones por repetición y presencia aplicadas mediante una máscara de vocabulario de tamaño fijo en lugar de una asignación por paso.
El nodo Generar texto expone esto mediante un nuevo widget mtp con las opciones auto, off y de 2 a 5. auto adapta la profundidad de redacción y los valores fijados la establecen. No tiene efecto en los checkpoints sin pesos MTP, y el tooltip señala que la salida muestreada conserva la distribución correcta pero difiere de la salida sin MTP para la misma semilla. La misma versión añade soporte W4A8 GEMV para estos codificadores, que se combina con los reempaquetados int8 y W4A8 que publica Comfy-Org.
Fast disk y memoria
v0.37.0 actualiza a comfy-aimdo 0.5.5, que incluye una implementación nativa en C de la detección de disco rápido en Windows. ComfyUI ahora detecta un disco rápido por sí solo y habilita automáticamente la carga dinámica respaldada por disco y el offload, por modelo, cuando la unidad es PCIe 4 NVMe o superior: los pesos se saltan el búfer de RAM y el paso de cebado del registro de pin. Las configuraciones mixtas dan prioridad a la RAM para las unidades más lentas, de modo que una biblioteca de modelos repartida entre un NVMe y un disco mecánico sigue usando la caché donde ayuda. --fast-disk sigue forzando el comportamiento y el nuevo --disable-fast-disk lo desactiva, anulando --fast-disk.
La misma versión incluye dos cambios de memoria más. El codificador de texto ahora se mantiene en la GPU siempre que la VRAM dinámica está habilitada, en lugar de moverse de un lado a otro, y el pico de VRAM de los modelos Wan baja cuando se usa la atención de comfy-kitchen.
Otros cambios
- Imagen Latente Vacía ahora usa 1024 x 1024 por defecto en lugar de 512 x 512, de modo que un nodo nuevo coincide con las resoluciones de entrenamiento de los modelos modernos.
- MiniMax Music 3 ya no genera ruido cuando los grafos del compilador de ComfyUI están habilitados: el codificador de texto autoregresivo ahora usa búferes de decodificación fijados (pinned) igual que YuE2 y la ruta de generación genérica.
- La decodificación VAE de ACE-Step ya no falla en GPUs que no ejecutan bf16.
- El nodo YuE2 Generar música incorporó un control CFG, y la precisión del embedding de posición de SheetSage2 se igualó a la del upstream.
- Se limpiaron nombres y categorías de nodos en todo el grafo.
- Nodos asociados: Meshy 7.1, fondos transparentes para GPT Image 2, una protección para rechazar una ejecución de Tripo P2 cuando su salida GLB o FBX vinculada estaría vacía, y una Idempotency-Key en las llamadas del proxy de socios para que los reintentos no se facturen dos veces.
- comfyui-frontend-package se actualiza a 1.53.6, las plantillas de flujo de trabajo a v0.11.66, los documentos integrados a 0.5.12 y comfy-kitchen a 0.2.35.
Cómo obtener v0.37.0
Actualiza ComfyUI a través del Administrador o del lanzador que prefieras. Los nodos de Qwen-Image 2.1 y MoGe 3 y sus plantillas requieren v0.37.0 o una versión posterior, mientras que las compilaciones de Desktop y Cloud siguen las versiones estables.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.