TRELLIS.2 y Pixal3D: imagen a 3D integrada en ComfyUI
ComfyUI ahora soporta imagen a 3D con TRELLIS.2 y Pixal3D: etapas de forma y textura, profundidad MoGe y posprocesado de malla con los pesos oficiales de Comfy-Org.
Descripción general
TRELLIS.2 es el modelo de imagen a 3D de 4 mil millones de parámetros de Microsoft. Utiliza la representación de vóxeles dispersos O-Voxel (omni-voxel) con un transformer de flow-matching para generar recursos 3D de alta fidelidad con topologías complejas, características nítidas y materiales PBR completos, incluida la transparencia. El modelo se publicó en diciembre de 2025 (consulta nuestra cobertura anterior) y no requiere pasadas de renderizado ni optimización durante la conversión.
Pixal3D es un modelo presentado en SIGGRAPH 2026 por Tencent ARC Lab y la Universidad de Tsinghua, construido sobre la base de TRELLIS.2. Utiliza características alineadas por píxeles mediante retroproyección para establecer correspondencias directas de píxel a 3D, alcanzando una fidelidad casi a nivel de reconstrucción con geometría detallada y texturas PBR a partir de una sola imagen.
Ejemplo de la etapa de textura de TRELLIS.2 (fuente: microsoft/TRELLIS.2)
Resultados de reconstrucción de Pixal3D a partir de una sola imagen (fuente: página del proyecto Pixal3D)
Soporte nativo de ComfyUI
El PR de integración añade una implementación sin dependencias de ambos modelos, además de una cadena completa de posprocesado de malla, todo reimplementado en PyTorch/scipy sin dependencias adicionales:
- Nodos de TRELLIS.2:
Trellis2ShapeStage,Trellis2TextureStage,Trellis2UpsampleStage,Trellis2Conditioning,EmptyTrellis2LatentStructure, además de decodificadores VAE dedicados de forma/textura (VaeDecodeShapeTrellis,VaeDecodeTextureTrellis) - Nodos de Pixal3D:
Pixal3DConditioning, junto con las etapas compartidas de TRELLIS.2; ambos modelos comparten los mismos VAE y el codificador de imágenes DINOv3 - Nodos de profundidad métrica MoGe:
LoadMoGeModel,MoGeInference,MoGePanoramaInference,MoGePointMapToMesh,MoGeGeometryToFOV,MoGeRenderpara la estimación de cámara/FoV y el acondicionamiento geométrico - Posprocesado de malla:
RemeshMesh(remallado DC),DecimateMesh(decimación QEM),UnwrapMesh(desenvolvimiento UV),ApplyTextureToMesh,BakeTextureFromVoxel,BakeAmbientOcclusion,BakeNormalMapFromMesh,FillHoles,WeldVertices,MeshSmoothNormals - Exportación 3D:
SaveGLB,Save3DAdvanced,SaveGaussianSplat,SavePointCloud,MeshToFile3D, además de las utilidadesMergeMeshesyRotateMesh
Flujo de trabajo de prueba para Pixal3D dentro de ComfyUI (fuente: Comfy-Org/ComfyUI PR #14718)
Flujo de trabajo
El flujo de trabajo oficial de ejemplo, alojado en el repositorio Comfy-Org/Pixal3D, ejecuta la cadena completa desde una sola imagen de entrada hasta la generación de forma, el horneado de texturas y la exportación de la malla:
Descarga de modelos
Los pesos reempaquetados de Comfy-Org proporcionan checkpoints listos para usar en precisión bf16 e INT8 ConvRot:
📂 ComfyUI/models/
├── 📂 diffusion_models/
│ ├── trellis_2_bf16.safetensors # or trellis_2_int8_convrot.safetensors
│ └── pixal3d_bf16.safetensors # or pixal3d_int8_convrot.safetensors
├── 📂 clip_vision/
│ └── dino_v3_vit_l.safetensors # Pixal3D uses dino_v3_L_naf_fp32.safetensors
└── 📂 vae/
├── trellis_2_shape_vae_bf16.safetensors
└── trellis_2_texture_vae_bf16.safetensors
Comentarios
Inicia sesión con GitHub para unirte a la conversación.