ComfyUI v0.36.0: soporte nativo de Marigold V2 y Concatenar vídeo

ComfyUI Wikinews

ComfyUI v0.36.0 añade estimación nativa de profundidad, normales y albedo con Marigold V2, tres flujos oficiales, el nodo Concatenar vídeo, FastH3, YuE2 y nuevos nodos asociados.

ComfyUI v0.36.0 ya está disponible. Incorpora la predicción densa de Marigold V2 (profundidad, normales de superficie y albedo) al núcleo con tres flujos de trabajo oficiales, un nuevo nodo Concatenar vídeo, soporte nativo de FastVideo FastH3 y YuE2, nodos de bucle genéricos y un conjunto de actualizaciones y correcciones de nodos asociados.
Vista previa de Marigold V2

Marigold V2 lee la geometría directamente de una sola imagen: profundidad, normales de superficie y albedo de la misma familia de checkpoint (vista previa del repositorio del proyecto).

Marigold V2: profundidad, normales de superficie y albedo

Marigold V2 proviene de HUAWEI Bayer Lab junto con EPFL y la Universidad de Bolonia, y se presenta en SIGGRAPH Asia 2026 (arXiv:2609.08084). En lugar de entrenar un nuevo modelo de difusión desde cero, ajusta Qwen-Image-Edit-2509 con pesos LoRA por tarea y decodificadores VAE ajustados, y luego lee la predicción del latent en un único paso de muestreo.

El soporte al núcleo llegó a través de Comfy-Org/ComfyUI#16232 (CORE-431), y las plantillas oficiales se distribuyen con los pesos reempaquetados por Comfy-Org en Comfy-Org/marigold-v2-0. Se cubren tres tareas:

  • Profundidad: profundidad logarítmica invariante a transformaciones afines con el checkpoint depth/Log-stage2 predeterminado del artículo, entrenado con Hypersim y Virtual KITTI 2 (unas 74k imágenes).
  • Normales de superficie: normales unitarias en el espacio de la cámara.
  • Albedo: albedo RGB lineal en [0, 1].

La versión upstream también incluye checkpoints de profundidad see-through (por capas) que predicen la geometría detrás del cristal, junto con ablaciones de profundidad uniforme y disparidad. El paquete de ComfyUI incluye las tres modalidades principales.

Resumen del método de Marigold V2

Resumen del método del repositorio del proyecto: un único backbone Qwen-Image-Edit-2509 se adapta para cada tarea de predicción densa.

Dentro de los flujos de trabajo de Marigold V2

Cada plantilla está construida como un subgrafo. Carga la base int8 ConvRot Qwen-Image-Edit-2509 qwen_image_edit_2509_int8_convrot.safetensors, aplica la LoRA de la tarea, carga un embedding de acondicionamiento precalculado y el VAE de la tarea, y luego muestrea con euler en sigmas de 0.5 -> 0, que es un solo paso. No se requiere codificador de texto: los embeddings del prompt se distribuyen como archivos *_conditioning.safetensors, cargados a través de ConditioningLoader.

Un nuevo nodo Posprocesado de Marigold V2 (MarigoldV2PostProcess, categoría image/geometry estimation) convierte la predicción decodificada en una imagen visualizable, con un conmutador prediction para depth (normalizado, lo cercano más brillante), normals (normales unitarias) o albedo (sRGB).

Archivos que esperan las plantillas:

📂 ComfyUI/
└── 📂 models/
    ├── 📂 diffusion_models/
    │   └── qwen_image_edit_2509_int8_convrot.safetensors
    ├── 📂 loras/
    │   ├── marigold_v2_depth_log_stage2.safetensors
    │   ├── marigold_v2_normals.safetensors
    │   └── marigold_v2_albedo.safetensors
    ├── 📂 embeddings/
    │   ├── marigold_v2_depth_conditioning.safetensors
    │   ├── marigold_v2_normals_conditioning.safetensors
    │   └── marigold_v2_albedo_conditioning.safetensors
    └── 📂 vae/
        ├── marigold_v2_depth_log_stage2_vae.safetensors
        ├── marigold_v2_normals_vae.safetensors
        └── marigold_v2_albedo_vae.safetensors

Cifras zero-shot publicadas con el modelo: AbsRel / δ1 de profundidad de 3.6 / 98.0 en NYUv2, 5.4 / 97.4 en KITTI, 2.8 / 99.2 en ETH3D, 3.7 / 97.9 en ScanNet y 5.2 / 97.1 en DIODE; error angular medio de las normales de superficie de 16.6° en NYUv2; albedo con PSNR 20.78 y SSIM 0.811 en el split de test de Hypersim.

Nodo Concatenar vídeo

La v0.36.0 añade un nodo Concatenar vídeo (ConcatenateVideo, categoría video) para unir clips de extremo a extremo dentro del grafo:

  • Las entradas se autogeneran como video1, video2, etc., hasta 100 segmentos, y se añaden en el orden de entrada.
  • Cuando los segmentos ya están codificados con un códec compatible, se concatenan sin decodificar.
  • codec tiene como valor predeterminado auto (H.264), y los vídeos ya codificados se dejan intactos.
  • Una entrada opcional complete_audio anula el audio que llevan los segmentos, lo cual resulta útil cuando los clips provienen de generaciones separadas.

Soporte de FastVideo FastH3 y YuE2

La versión también promueve dos modelos anteriores a la compilación principal:

  • FastVideo FastH3, el MiniMax H3 destilado en 8 pasos para texto a vídeo e imagen a vídeo con audio nativo. Consulta FastH3 8-Step V2 obtiene plantillas nativas de ComfyUI para los checkpoints y las configuraciones de atención VSA en las que se basan las plantillas.
  • YuE2, generación de música a partir de prompts de estilo y letras, con correcciones posteriores para sistemas AMD, una duración máxima de canción mayor y más controles en el nodo de generación. Cobertura anterior: YuE2.

Otros cambios en nodos y en el núcleo

  • Bucles genéricos: Start Loop y End Loop llegaron en la misma versión para iterar sobre listas dentro de un grafo, junto con Create List y Get Item From List.
  • Convertir espacio de color de imagen ahora incluye un destino linear (Rec.709 lineal), además de los espacios sRGB, HDR y HDR PQ ya existentes.
  • Nodo de texto Gemini: se añadió GeminiNodeV3 y el nodo V2 quedó obsoleto.
  • MiniMax H3: el consumo de memoria del VAE de vídeo se redujo aún más sobre la base del trabajo de VAE int8 ConvRot.
  • AMD en Windows: la cuota de direcciones virtuales se elevó a 4TB (CORE-409), y se eliminó una puerta muerta de arquitectura triton de ROCm de las operaciones de cuantización.

Actualizaciones de nodos asociados

  • Tripo P2: nodos de generación de modelos 3D a partir de texto, imagen y multivista.
  • Pruna P-Video-2: texto a vídeo e imagen a vídeo a 720p/1080p con modo borrador.
  • BFL: un nodo Edición de vídeo Flux que edita un clip de origen a partir de una instrucción de texto.
  • Bria: nuevos nodos de edición de imagen y un nodo Eliminador de vídeo (Video Eraser).
  • OpenRouter: modelos mai-image-2.6 de Microsoft y relación de aspecto automática en el nodo de imagen.
  • Cliente: el progreso de los nodos asociados ahora consume las cabeceras de duración estimada para mostrar el progreso.

Correcciones y otros cambios

  • Se corrigió H3 Fun ControlNet cuando el compilador de ComfyUI está habilitado.
  • El nodo ImagenAgregarRuido ya no añade ruido al canal alfa.
  • Se corrigieron los problemas de Yue2 en AMD y se añadieron más controles al nodo ABC de generación.
  • RoPE ahora se aplica con kernels rápidos en más modelos basados en llama, lo que cubre los codificadores de texto que usan los modelos de la clase Qwen-Image-Edit.
  • comfy-kitchen actualizado a 0.2.34, comfyui-frontend-package a 1.52.7 y las plantillas de flujos de trabajo a v0.11.62.
  • Los registros de recursos se separaron del contenido tras el flag --enable-assets.

Cómo obtener la v0.36.0

Actualiza ComfyUI mediante el Administrador o el launcher que prefieras. Los flujos de trabajo de Marigold V2 y el nodo Concatenar vídeo requieren la v0.36.0 o una versión más reciente, mientras que las compilaciones de Desktop y Cloud siguen las versiones estables.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
ComfyUI v0.36.0: soporte nativo de Marigold V2 y Concatenar vídeo | ComfyUI Wiki