Pixal3D Multi-Vista llega a ComfyUI: Mejor 3D desde 4 ángulos

ComfyUI Wikinews

ComfyUI añade soporte nativo multi-vista de Pixal3D con pesos oficiales bf16 e INT8: cuatro tomas orbitales se convierten en una malla 3D más limpia.

Pixal3D (GitHub, página del proyecto) lanzó su código de inferencia multi-vista el 1 de septiembre de 2026, y el núcleo de ComfyUI implementó soporte nativo para los pesos multi-vista el 8 de septiembre en PR #16048. En lugar de una imagen, ahora puedes alimentar hasta cuatro tomas orbitales del mismo objeto, y el nuevo Pixal3DMultiViewConditioning nodo los combina en una sola malla más precisa. Los nuevos pesos oficiales de Comfy-Org/Pixal3D vienen en bf16 e INT8 ConvRot.
Node graph del flujo de trabajo multi-vista de Pixal3D en ComfyUI

Ejemplo del PR de soporte multi-vista: varias vistas del mismo objeto condicionan un paso de generación.

Por qué importa la entrada multi-vista

Una sola foto deja la parte trasera de un objeto a la imaginación del modelo, que es donde los resultados de imagen-a-3D suelen fallar más: geometría alucinada, texto difuminado o texturas que se doblan alrededor de la silueta. La ruta multi-vista de Pixal3D condiciona la cascada de forma y textura en varias vistas del mismo objeto a la vez, para que las superficies que aparecen en cualquier imagen de entrada se reconstruyan por observación en lugar de adivinarse.

Fuentes típicas para esas vistas:

  • Unas pocas fotos tomadas alrededor de un objeto físico
  • Cuadros renderizados desde un activo 3D existente que deseas estilizar
  • Salida de un modelo de difusión multi-vista, que es exactamente el formato orbital que espera el modelo

Qué añade la integración de ComfyUI

El PR de integración extiende el conjunto de nodos existente TRELLIS.2/Pixal3D con un nuevo nodo y dos nuevos pesos oficiales:

  • Pixal3DMultiViewConditioning: toma un modelo de visión CLIP más hasta cuatro imágenes de vista (delante, izquierda, atrás, derecha). La primera vista define el frente del objeto; el nodo advierte si tu pose no coincide. Un único parámetro fov (por defecto 20.0) describe la cámara para todas las vistas, lo cual coincide con los arneses orbitales sintéticos que producen los modelos de difusión multi-vista.
  • Nuevos pesos en Comfy-Org/Pixal3D: pixal3d_multiview_bf16.safetensors y pixal3d_multiview_int8_convrot.safetensors se encuentran junto a los checkpoints de imagen única en la misma carpeta diffusion_models. El Shape VAE, el texture VAE y el codificador de visión CLIP DINOv3 se comparten con la tubería de imagen única, por lo que una instalación existente de Pixal3D solo necesita el archivo del modelo de difusión nuevo.
Node graph del flujo de trabajo multi-vista de Pixal3D en ComfyUI

El flujo de trabajo de prueba oficial multi-vista: cuatro imágenes de vista entran en Pixal3DMultiViewConditioning antes de las etapas compartidas de forma y textura (fuente: Comfy-Org/ComfyUI PR #16048).

Cómo usarlo en ComfyUI

  1. Actualizar ComfyUI a una compilación que incluya el PR #16048 (8 de septiembre de 2026 o posterior).
  2. Descargar pixal3d_multiview_bf16.safetensors (o la versión INT8 ConvRot para menor VRAM) desde Comfy-Org/Pixal3D a ComfyUI/models/diffusion_models/.
  3. Cargar el flujo de trabajo a continuación y conectar tus vistas: primero la delantera, luego la izquierda, atrás y derecha. Las vistas sin canal alfa se matizan automáticamente, pero mantén cada vista sin recortar, ya que el encuadre codifica la cámara.

Si solo tienes una vista del objeto, sigue usando el flujo de trabajo de imagen única original de nuestra cobertura anterior: los pesos multi-vista son un archivo separado, no un reemplazo.

Segundo ejemplo de Pixal3D multi-vista

Segundo ejemplo del PR: vistas orbitales y la malla texturizada resultante.

Disponibilidad

  • Pesos: Comfy-Org/Pixal3D (empaquetado para ComfyUI, licencia MIT) y el repositorio original TencentARC/Pixal3D, cuyos checkpoints ckpts/*_mv corresponden a los archivos de ComfyUI.
  • Implementación de referencia: inference_mv.py en el repositorio TencentARC/Pixal3D, lanzado el 1 de septiembre de 2026 con un formato de cámara transforms.json estilo Blender/NeRF para arneses de vista personalizados.
  • Demo: el Espacio TencentARC/Pixal3D actualmente cubre la ruta de imagen única.

Comentarios

Inicia sesión con GitHub para unirte a la conversación.

Cargando comentarios…
Pixal3D Multi-Vista llega a ComfyUI: Mejor 3D desde 4 ángulos | ComfyUI Wiki