Pixal3D Multi-Vista llega a ComfyUI: Mejor 3D desde 4 ángulos
ComfyUI añade soporte nativo multi-vista de Pixal3D con pesos oficiales bf16 e INT8: cuatro tomas orbitales se convierten en una malla 3D más limpia.
Pixal3DMultiViewConditioning nodo los combina en una sola malla más precisa. Los nuevos pesos oficiales de Comfy-Org/Pixal3D vienen en bf16 e INT8 ConvRot.
Ejemplo del PR de soporte multi-vista: varias vistas del mismo objeto condicionan un paso de generación.
Por qué importa la entrada multi-vista
Una sola foto deja la parte trasera de un objeto a la imaginación del modelo, que es donde los resultados de imagen-a-3D suelen fallar más: geometría alucinada, texto difuminado o texturas que se doblan alrededor de la silueta. La ruta multi-vista de Pixal3D condiciona la cascada de forma y textura en varias vistas del mismo objeto a la vez, para que las superficies que aparecen en cualquier imagen de entrada se reconstruyan por observación en lugar de adivinarse.
Fuentes típicas para esas vistas:
- Unas pocas fotos tomadas alrededor de un objeto físico
- Cuadros renderizados desde un activo 3D existente que deseas estilizar
- Salida de un modelo de difusión multi-vista, que es exactamente el formato orbital que espera el modelo
Qué añade la integración de ComfyUI
El PR de integración extiende el conjunto de nodos existente TRELLIS.2/Pixal3D con un nuevo nodo y dos nuevos pesos oficiales:
Pixal3DMultiViewConditioning: toma un modelo de visión CLIP más hasta cuatro imágenes de vista (delante, izquierda, atrás, derecha). La primera vista define el frente del objeto; el nodo advierte si tu pose no coincide. Un único parámetrofov(por defecto20.0) describe la cámara para todas las vistas, lo cual coincide con los arneses orbitales sintéticos que producen los modelos de difusión multi-vista.- Nuevos pesos en Comfy-Org/Pixal3D:
pixal3d_multiview_bf16.safetensorsypixal3d_multiview_int8_convrot.safetensorsse encuentran junto a los checkpoints de imagen única en la misma carpetadiffusion_models. El Shape VAE, el texture VAE y el codificador de visión CLIP DINOv3 se comparten con la tubería de imagen única, por lo que una instalación existente de Pixal3D solo necesita el archivo del modelo de difusión nuevo.
El flujo de trabajo de prueba oficial multi-vista: cuatro imágenes de vista entran en Pixal3DMultiViewConditioning antes de las etapas compartidas de forma y textura (fuente: Comfy-Org/ComfyUI PR #16048).
Cómo usarlo en ComfyUI
- Actualizar ComfyUI a una compilación que incluya el PR #16048 (8 de septiembre de 2026 o posterior).
- Descargar
pixal3d_multiview_bf16.safetensors(o la versión INT8 ConvRot para menor VRAM) desde Comfy-Org/Pixal3D aComfyUI/models/diffusion_models/. - Cargar el flujo de trabajo a continuación y conectar tus vistas: primero la delantera, luego la izquierda, atrás y derecha. Las vistas sin canal alfa se matizan automáticamente, pero mantén cada vista sin recortar, ya que el encuadre codifica la cámara.
Si solo tienes una vista del objeto, sigue usando el flujo de trabajo de imagen única original de nuestra cobertura anterior: los pesos multi-vista son un archivo separado, no un reemplazo.
Segundo ejemplo del PR: vistas orbitales y la malla texturizada resultante.
Disponibilidad
- Pesos: Comfy-Org/Pixal3D (empaquetado para ComfyUI, licencia MIT) y el repositorio original TencentARC/Pixal3D, cuyos checkpoints
ckpts/*_mvcorresponden a los archivos de ComfyUI. - Implementación de referencia:
inference_mv.pyen el repositorio TencentARC/Pixal3D, lanzado el 1 de septiembre de 2026 con un formato de cámaratransforms.jsonestilo Blender/NeRF para arneses de vista personalizados. - Demo: el Espacio TencentARC/Pixal3D actualmente cubre la ruta de imagen única.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.