NVIDIA Cosmos3-Edge : modèle de monde omnimodal 4B pour la vidéo
NVIDIA publie Cosmos3-Edge, un modèle de monde MoT de 4B générant vidéo, images et audio à partir de texte et d'images, avec des nœuds ComfyUI.
NVIDIA Cosmos3-Edge est le plus récent membre de la famille Cosmos 3 de modèles de monde omnimodaux ouverts. Ce modèle Mixture-of-Transformers (MoT) de 4B accepte en entrée du texte, des images, des vidéos et des trajectoires d'action, et génère en sortie du texte, des images, des vidéos et des actions cohérents, couvrant la simulation de monde, la prédiction du futur et le raisonnement d'action pour les applications de Physical AI.
Qu'est-ce que Cosmos 3
Cosmos 3 unifie compréhension, génération, simulation et action dans un seul transformer : une tour autorégressive gère les jetons de texte discrets tandis qu'un transformer de diffusion synthétise images, vidéo, audio et actions par débruitage itératif. Il n'y a pas d'encodeur de texte séparé — les jetons de langage et de diffusion traversent un seul transformer partagé, qui lit sa propre architecture depuis le checkpoint.
| Modèle | Taille | Points clés |
|---|---|---|
| Cosmos3-Edge | 4B | Texte-vers-vidéo, image-vers-vidéo, génération conditionnée par actions (backbone Nemotron-dense) |
| Cosmos3-Nano | 16B | Omnimodal : texte, image, vidéo, audio + actions |
| Cosmos3-Super | 64B | Plus grand modèle omnimodal |
| Cosmos3-Super-Image2Video-4Step | 64B | Distillé DMD2, image-vers-vidéo en 4 étapes |
| Cosmos3-Super-Text2Image-4Step | 64B | Distillé DMD2, texte-vers-image en 4 étapes |
Cosmos3-Edge accepte des entrées texte et image en 256p et 480p avec les ratios 16:9, 4:3, 1:1, 3:4 et 9:16, et son conditionnement par actions fonctionne sur divers embodiments robotiques : bras Franka Panda, véhicules autonomes, drones et trajectoires de caméra. Les sorties ci-dessous montrent la génération audio-vidéo conditionnée par actions depuis la fiche du modèle :
Support ComfyUI
Cosmos3 ne fait pas partie du cœur de ComfyUI, mais le pack de nœuds communautaires ComfyUI-Cosmos3 supporte toute la famille Cosmos3 — y compris Cosmos3-Edge pour le texte-vers-vidéo et l'image-vers-vidéo — via la pile KSampler / SamplerCustomAdvanced intégrée :
- Clonez
ComfyUI-Cosmos3dansComfyUI/custom_nodes/et installez sonrequirements.txt - Téléchargez un checkpoint (ex.
nvidia/Cosmos3-Edge) dansComfyUI/models/cosmos3/<name>/; le chargeur lit l'architecture depuistransformer/config.json, aucune configuration manuelle n'est nécessaire - Échantillonnez avec le scheduler flow-matching
uni_pc_bh2; la tour de texte est pré-remplie une fois par prompt et ses K/V réutilisés entre les étapes de débruitage
Le pack fournit des workflows d'exemple pour le texte-vers-vidéo, l'image-vers-vidéo, l'audio-vidéo conjoint et les checkpoints Super distillés en 4 étapes :
Disponibilité
Les poids sont ouverts sur Hugging Face, avec la collection de modèles sur huggingface.co/collections/nvidia/cosmos3. Le code officiel d'inférence et d'entraînement vit dans le dépôt NVIDIA Cosmos et le Cosmos Framework, et le rapport technique est sur la page de recherche Cosmos 3.
Commentaires
Connectez-vous avec GitHub pour rejoindre la discussion.