ComfyUI v0.38.0: Ming-Image, ID-V2V y SeedVR2 más rápido

ComfyUI Wikinews

ComfyUI v0.38.0 añade Ming-Image nativo con plantilla oficial, incorpora Wan ID-V2V, la cuantización w6a8 y los espacios HDR LogC3 y ACEScct, y acelera SeedVR2 y YuE2.

ComfyUI v0.38.0 ya está disponible. Incorpora Ming-Image al núcleo con una plantilla oficial, añade el tan esperado soporte de Wan ID-V2V, suma la cuantización w6a8, los espacios de color HDR LogC3 y HDR ACEScct, y reduce la memoria en SeedVR2 al decodificar el vídeo fotograma a fotograma.
Salida de Ming-Image 0.1 Design desde la plantilla oficial de ComfyUI

Una composición de diseño generada por la plantilla oficial Ming-Image 0.1 Design, que escribe salida RGBA con transparencia (recurso del repositorio workflow_templates).

Ming-Image en el núcleo

Ming-Image 0.1 Design ahora se ejecuta de forma nativa. El soporte en el núcleo llegó en Comfy-Org/ComfyUI#16482 con una corrección de detección posterior en #16514, después de que el mismo cambio se hubiera incluido en el parche v0.37.3 y se revirtiera de nuevo en v0.37.4. Si el modelo apareció y luego desapareció para ti en la rama estable, v0.38.0 es donde se queda.

El port añade un nodo de acondicionamiento dedicado, Text Encode Ming Image Edit (TextEncodeMingImageEdit, categoría model/conditioning/ming image). Tokeniza el prompt junto con hasta ocho imágenes de referencia (image_1 a image_8) en el text encoder de Ming, y la entrada de VAE es opcional: sin ella, las imágenes solo condicionan a través de la torre de visión, mientras que con ella cada referencia se añade a la secuencia latente como un fotograma limpio. Las referencias posteriores se redimensionan al tamaño de la primera, y el latente muestreado debe coincidir con el tamaño de esa primera imagen.

En cuanto al modelo, Ming-Image es un DiT de 30 capas sobre un espacio latente de 16 canales con su propio formato latente MingImage, y se ejecuta con un shift de 3.16 en el bucket de 1024. El text encoder es el modelo de lenguaje Ling-Mini-2.0 incluido, un MoE de 20 capas con 256 expertos, emparejado con una torre de visión estilo Qwen para las imágenes de referencia. Dos checkpoints funcionan con el mismo grafo de nodos: el modelo Design y su hermano Design Layer, que descompone un diseño finalizado en capas transparentes editables.

Los pesos reempaquetados se publican como Comfy-Org/Ming-Image en variantes bf16 e int8_convrot:

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   ├── ming_image_0.1_design_bf16.safetensors
    │   ├── ming_image_0.1_design_int8_convrot.safetensors
    │   ├── ming_image_0.1_design_layer_bf16.safetensors
    │   └── ming_image_0.1_design_layer_int8_convrot.safetensors
    ├── 📂 text_encoders/
    │   ├── ming_image_0.1_ling_mini_2.0_bf16.safetensors
    │   └── ming_image_0.1_ling_mini_2.0_int8_convrot.safetensors
    └── 📂 vae/
        └── ming_image_vae_bf16.safetensors

La plantilla oficial image_ming_image_01_design_t2i conecta todo el pipeline, incluida una etapa de mejora del prompt: un text encoder Qwen3.8-27B (distribuido como qwen3.8_27b_w4a8.safetensors) reescribe una petición corta en un brief de diseño JSON estructurado al estilo Figma, y ese brief es lo que recibe el text encoder de Ming. El muestreo es de 12 pasos de Euler con ModelSamplingFlux en un latente de 1024x2048.

Qwen-Image 2.1 y actualizaciones de ControlNet

La ruta de Qwen-Image 2.1 sigue recibiendo trabajo:

  • Union Fun ControlNet ahora es compatible (#16519) con alibaba-pai/Qwen-Image-2.1-Fun-Controlnet-Union, el único ControlNet que cubre los tipos individuales de Fun ControlNet. El soporte correspondiente de H3 Fun-ControlNet-Union 2.0 desde #16471 también está incluido en esta versión.
  • Soporte de Tiny VAE (#16552) añade taeqi2_1_decoder y taeqi2_1_encoder de taesd de madebyollin, así que Qwen-Image 2.1 obtiene vistas previas de latentes rápidas y un ciclo de ida y vuelta TAESD económico. Coloca los archivos en models/vae_approx/. Son modelos de 16x con 64 canales latentes y un lado de imagen RGBA de 4 canales, con escala y desplazamiento por canal en lugar de los escalares que usaban las variantes anteriores de TAESD.
  • La ubicación del prefijo de caché KV (#16429) ahora se decide con la contabilidad de memoria libre del model patcher, por lo que la caché puede permanecer en VRAM con VRAM dinámica y memoria inteligente en lugar de recurrir a un recálculo completo. La compilación de bloques Transformer (#16430) añade soporte del compilador de memoria, lo que ayuda principalmente cuando el ancho de banda de offload es el cuello de botella.
  • Un clamp de activación fp16 (#16608) corrige una asignación in situ que rompía el compilador de memoria, y el preprocesamiento de imágenes de Qwen VL ya no falla con entradas RGBA de 4 canales (#16548).

Llega Wan ID-V2V

El PR de soporte de ID-V2V, Comfy-Org/ComfyUI#15139, finalmente se fusionó el 2026-09-27 y llega en esta versión. ID-V2V cambia el estilo del vídeo mientras preserva la identidad, y está construido sobre una base Wan 2.1 de imagen a vídeo con control VACE, una combinación que ComfyUI no podía cargar anteriormente.

Dos cambios lo hacen posible. La detección de modelos reconoce la arquitectura cuando un modelo VACE incluye la proyección img_emb de una base I2V, y Image to Video ahora acepta una entrada opcional ref_pad_image. Esa entrada rellena los fotogramas de padding del acondicionamiento de imagen con una imagen de referencia en lugar de gris plano, que es el padding anti-drift con el que se entrenó el modelo. ref_pad_image es opcional, por lo que los flujos de trabajo I2V existentes no se ven afectados.

Los pesos de prueba permanecen en Hugging Face: Kijai/Wan_ID_V2V_comfy publica wan_2.1_idv2v_int8_convrot.safetensors y una variante con control de profundidad normal, y el PR incluye un JSON de flujo de trabajo listo.

Cuantización: w6a8

ComfyUI ahora puede cargar checkpoints w6a8 (#16483, implementado en comfy-kitchen): pesos de 6 bits con activaciones de 8 bits, por lo que el archivo es más pequeño que los repacks int8 y fp8. Los pesos H3 podados ya están publicados en el nuevo formato en Comfy-Org/MiniMax-H3 como minimax_h3_fl2va_pruned_w6a8.safetensors y minimax_h3_ref2va_pruned_w6a8.safetensors, junto a los archivos existentes bf16, fp8_scaled e int8_convrot.

SeedVR2 y YuE2 más rápidos en ComfyUI

SeedVR2 (#16530) es una reescritura importante del VAE de esta herramienta de upscale. Cuando el modelo lo permite, el VAE ahora procesa el vídeo fotograma a fotograma, mantiene sus cachés de convolución causal cuantizadas a int8 en memoria de host fijada y las vuelve a precargar cuando es necesario. Por lo tanto, el uso de VRAM lo determina el conjunto de trabajo de un solo fotograma en lugar de todo el clip, algo que importa en vídeos largos o de alta resolución. Requiere los kernels de comfy-kitchen de la misma versión.

Salida del upscale de SeedVR2 con la plantilla oficial

Salida de la plantilla oficial de upscale de imagen de SeedVR2 (recurso del repositorio workflow_templates).

Dos rutas de audio también se han vuelto más rápidas:

  • YuE2 (#16626) ahora agrupa en lotes las transferencias de tokens desde la GPU de vuelta a la CPU y ejecuta su muestreador mediante grafos CUDA.
  • ACE-Step 1.5 (#16461) incorpora grafos CUDA y el compilador de memoria en su modelo autoregresivo.

También se incluyen dos correcciones de MiniMax H3: el VAE ahora combina las decodificaciones en mosaico con los vecinos ya compuestos (#16436), y se corrige un error de alineación que hacía fallar el VAE de H3 cuando qk_norm_scale se descargaba a la CPU (#16485). Ampliar Imagen (Using Model) ya no provoca un fallo con imágenes RGBA (#16500).

Espacios de color HDR

Convertir espacio de color de imagen (ImageColorSpace) incorporó dos codificaciones logarítmicas (#16541): HDR LogC3 (la curva EI 800 con primarios Rec.709) y HDR ACEScct (primarios AP1 y blanco D60, adaptados a D65 mediante adaptación cromática Bradford). Junto con los destinos ya existentes sRGB, Rec.709 lineal, HDR HLG y HDR PQ, un flujo de trabajo ahora puede moverse entre los espacios de color que espera un pipeline de VFX o EXR. Una corrección posterior (#16565) gestiona los valores negativos en la ruta de salida HDR.

Memoria, atención y cargadores

  • Los archivos de modelo ahora pueden declarar qué implementación de atención debe usar cada bloque (#16419), lo que permite que un repack combine distintos backends de atención dentro de un mismo modelo.
  • El soporte de comfy_attention y AttentionTensorContainer se extiende a la familia Lumina (#16515), a algunas familias de modelos más (#16595) y, con un menor uso de memoria, a la familia Flux (#16488).
  • La detección de disco rápido añadida para la carga dinámica en la v0.37.0 ahora abarca todos los cargadores de modelos (#16425), y se añadieron las arquitecturas AMD RDNA2 y anteriores a la lista de arquitecturas (#16537).
  • Los dispositivos Ascend NPU ahora disponen de flujos asíncronos de offload de pesos (#16057).
  • El sistema de recursos recibió una ronda de refuerzo y de trabajo en rendimiento: el bloqueo de escritura de SQLite se toma por adelantado y las lecturas de archivos se movieron fuera de las transacciones de escritura (#16480, #16486), los reescaneos de salida listan carpetas en lugar de comprobar cada archivo y pausan sus bucles para que la interfaz siga respondiendo (#16543, #16546), y ComfyUI arranca incluso cuando faltan los paquetes de recursos, informando de lo que necesita --enable-assets (#16580).

Otros cambios

  • Text Generate acepta una entrada opcional system_prompt y devuelve el bloque de razonamiento en su propia salida (#16442).
  • Se eliminó la dependencia de torchaudio, ya que upstream dejó de distribuir compilaciones estables para cu132 (#16457).
  • Se incluye el soporte para MiniMax H3 Fun-ControlNet-Union 2.0 de #16471, y la creación de ABC de SheetSage2 se alineó con el código YuE de upstream (#16569).
  • Nodos asociados: Hunyuan Image 3.5 texto a imagen y edición (Tencent, #16462), Arrow 2 con esfuerzo de razonamiento en los nodos SVG (Quiver, #16478), Claude Opus 5.5 (#16479), Recraft V4.1 Flash (#16501), GPT-6 Sol y Luna (OpenAI, #16520), Seedream 5.0 Flash (#16522) y Seedance 2.5 modo Draft (#16529). Se eliminaron los nodos Sora obsoletos (#16609). Varias de estas incorporaciones de socios ya se publicaron en las versiones de parche v0.37.x.
  • Las plantillas de flujos de trabajo están en la v0.11.70, comfy-kitchen en la 0.2.36 y la documentación integrada en la 0.5.13.

Cómo obtener ComfyUI v0.38.0

Actualiza a través del Administrador de ComfyUI o tu launcher. El soporte de ControlNet para Qwen-Image 2.1 y del tiny VAE, los nuevos espacios de color y ID-V2V necesitan la v0.38.0 o una versión más reciente. Ming-Image es el que hay que seguir de cerca en la línea de parches: los nodos estuvieron presentes en la v0.37.3 y se revirtieron de nuevo en la v0.37.4, así que la v0.38.0 es la versión en la que el soporte se mantiene.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
ComfyUI v0.38.0: Ming-Image, ID-V2V y SeedVR2 más rápido | ComfyUI Wiki