NVIDIA Cosmos3-Edge : modèle de monde omnimodal 4B pour la vidéo

ComfyUI Wikinews

NVIDIA publie Cosmos3-Edge, un modèle de monde MoT de 4B générant vidéo, images et audio à partir de texte et d'images, avec des nœuds ComfyUI.

NVIDIA Cosmos3-Edge est le plus récent membre de la famille Cosmos 3 de modèles de monde omnimodaux ouverts. Ce modèle Mixture-of-Transformers (MoT) de 4B accepte en entrée du texte, des images, des vidéos et des trajectoires d'action, et génère en sortie du texte, des images, des vidéos et des actions cohérents, couvrant la simulation de monde, la prédiction du futur et le raisonnement d'action pour les applications de Physical AI.

Qu'est-ce que Cosmos 3

Cosmos 3 unifie compréhension, génération, simulation et action dans un seul transformer : une tour autorégressive gère les jetons de texte discrets tandis qu'un transformer de diffusion synthétise images, vidéo, audio et actions par débruitage itératif. Il n'y a pas d'encodeur de texte séparé — les jetons de langage et de diffusion traversent un seul transformer partagé, qui lit sa propre architecture depuis le checkpoint.

ModèleTaillePoints clés
Cosmos3-Edge4BTexte-vers-vidéo, image-vers-vidéo, génération conditionnée par actions (backbone Nemotron-dense)
Cosmos3-Nano16BOmnimodal : texte, image, vidéo, audio + actions
Cosmos3-Super64BPlus grand modèle omnimodal
Cosmos3-Super-Image2Video-4Step64BDistillé DMD2, image-vers-vidéo en 4 étapes
Cosmos3-Super-Text2Image-4Step64BDistillé DMD2, texte-vers-image en 4 étapes

Cosmos3-Edge accepte des entrées texte et image en 256p et 480p avec les ratios 16:9, 4:3, 1:1, 3:4 et 9:16, et son conditionnement par actions fonctionne sur divers embodiments robotiques : bras Franka Panda, véhicules autonomes, drones et trajectoires de caméra. Les sorties ci-dessous montrent la génération audio-vidéo conditionnée par actions depuis la fiche du modèle :

Sortie audio-vidéo conditionnée par actions de Cosmos3-Edge Sortie audio-vidéo conditionnée par actions de Cosmos3-Edge

Support ComfyUI

Cosmos3 ne fait pas partie du cœur de ComfyUI, mais le pack de nœuds communautaires ComfyUI-Cosmos3 supporte toute la famille Cosmos3 — y compris Cosmos3-Edge pour le texte-vers-vidéo et l'image-vers-vidéo — via la pile KSampler / SamplerCustomAdvanced intégrée :

  1. Clonez ComfyUI-Cosmos3 dans ComfyUI/custom_nodes/ et installez son requirements.txt
  2. Téléchargez un checkpoint (ex. nvidia/Cosmos3-Edge) dans ComfyUI/models/cosmos3/<name>/ ; le chargeur lit l'architecture depuis transformer/config.json, aucune configuration manuelle n'est nécessaire
  3. Échantillonnez avec le scheduler flow-matching uni_pc_bh2 ; la tour de texte est pré-remplie une fois par prompt et ses K/V réutilisés entre les étapes de débruitage

Le pack fournit des workflows d'exemple pour le texte-vers-vidéo, l'image-vers-vidéo, l'audio-vidéo conjoint et les checkpoints Super distillés en 4 étapes :

Disponibilité

Les poids sont ouverts sur Hugging Face, avec la collection de modèles sur huggingface.co/collections/nvidia/cosmos3. Le code officiel d'inférence et d'entraînement vit dans le dépôt NVIDIA Cosmos et le Cosmos Framework, et le rapport technique est sur la page de recherche Cosmos 3.

Commentaires

Connectez-vous avec GitHub pour rejoindre la discussion.

Chargement des commentaires…
NVIDIA Cosmos3-Edge : modèle de monde omnimodal 4B pour la vidéo | ComfyUI Wiki