TRELLIS.2 et Pixal3D : l'image-vers-3D intégrée à ComfyUI
ComfyUI prend en charge l'image-vers-3D TRELLIS.2 et Pixal3D : étapes de forme et de texture, profondeur MoGe et post-traitement du maillage avec les poids officiels Comfy-Org.
Vue d'ensemble
TRELLIS.2 est le modèle image-vers-3D de Microsoft à 4 milliards de paramètres. Il utilise la représentation en voxels creux O-Voxel (omni-voxel) avec un transformer de correspondance de flux (flow-matching) pour générer des ressources 3D haute fidélité avec des topologies complexes, des arêtes vives et des matériaux PBR complets, y compris la transparence. Le modèle a été publié en décembre 2025 (voir notre couverture précédente) et ne nécessite aucune passe de rendu ou d'optimisation lors de la conversion.
Pixal3D est un modèle SIGGRAPH 2026 de Tencent ARC Lab et de l'Université Tsinghua, construit sur l'architecture de base de TRELLIS.2. Il utilise des caractéristiques alignées sur les pixels via une rétro-projection pour établir des correspondances directes pixel-vers-3D, atteignant une fidélité proche du niveau de reconstruction avec une géométrie détaillée et des textures PBR à partir d'une seule image.
Exemple de l'étape de texture de TRELLIS.2 (source : microsoft/TRELLIS.2)
Résultats de reconstruction à partir d'une seule image de Pixal3D (source : page du projet Pixal3D)
Prise en charge native de ComfyUI
Le PR d'intégration ajoute une implémentation sans dépendance des deux modèles ainsi qu'une chaîne complète de post-traitement du maillage, le tout réimplémenté en PyTorch/scipy avec aucune dépendance supplémentaire :
- Nœuds TRELLIS.2 :
Trellis2ShapeStage,Trellis2TextureStage,Trellis2UpsampleStage,Trellis2Conditioning,EmptyTrellis2LatentStructure, plus des décodeurs VAE dédiés forme/texture (VaeDecodeShapeTrellis,VaeDecodeTextureTrellis) - Nœuds Pixal3D :
Pixal3DConditioningavec les étapes TRELLIS.2 partagées ; les deux modèles partagent les mêmes VAE et l'encodeur d'image DINOv3 - Nœuds de profondeur métrique MoGe :
LoadMoGeModel,MoGeInference,MoGePanoramaInference,MoGePointMapToMesh,MoGeGeometryToFOV,MoGeRenderpour l'estimation caméra/champ de vision et le conditioning géométrique - Post-traitement du maillage :
RemeshMesh(remesh DC),DecimateMesh(décimation QEM),UnwrapMesh(dépliage UV),ApplyTextureToMesh,BakeTextureFromVoxel,BakeAmbientOcclusion,BakeNormalMapFromMesh,FillHoles,WeldVertices,MeshSmoothNormals - Exportation 3D :
SaveGLB,Save3DAdvanced,SaveGaussianSplat,SavePointCloud,MeshToFile3D, plus les outilsMergeMeshesetRotateMesh
Flux de travail de test pour Pixal3D dans ComfyUI (source : PR Comfy-Org/ComfyUI #14718)
Flux de travail
Le flux de travail d'exemple officiel, hébergé dans le référentiel Comfy-Org/Pixal3D, exécute la chaîne complète depuis une seule image d'entrée jusqu'à la génération de forme, la cuisson de texture et l'exportation du maillage :
Téléchargement des modèles
Les poids réempaquetés par Comfy-Org fournissent des checkpoints prêts à l'emploi en précision bf16 et INT8 ConvRot :
📂 ComfyUI/models/
├── 📂 diffusion_models/
│ ├── trellis_2_bf16.safetensors # or trellis_2_int8_convrot.safetensors
│ └── pixal3d_bf16.safetensors # or pixal3d_int8_convrot.safetensors
├── 📂 clip_vision/
│ └── dino_v3_vit_l.safetensors # Pixal3D uses dino_v3_L_naf_fp32.safetensors
└── 📂 vae/
├── trellis_2_shape_vae_bf16.safetensors
└── trellis_2_texture_vae_bf16.safetensors
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.