NVIDIA Cosmos3-Edge: Modelo Mundial Omnimodal Abierto de 4B para Vídeo
NVIDIA lanza Cosmos3-Edge, un modelo de mundo MoT de 4B que genera vídeo, imágenes y audio desde texto e imágenes, con nodos ComfyUI.
NVIDIA Cosmos3-Edge es el miembro más reciente de la familia Cosmos 3 de modelos mundiales omnimodales abiertos. El modelo Mixture-of-Transformers (MoT) de 4B toma texto, imágenes, vídeo y trayectorias de acción como entrada y genera salidas coherentes de texto, imágenes, vídeo y acciones, lo que cubre la simulación del mundo, la predicción del futuro y el razonamiento de acciones para aplicaciones de IA Física.
¿Qué es Cosmos 3?
Cosmos 3 unifica la comprensión, la generación, la simulación y la acción en un único transformer: una torre autoregresiva maneja tokens de texto discretos mientras que un transformer de difusión sintetiza imágenes, vídeo, audio y acciones mediante denoising iterativo. No existe un codificador de texto separado: los tokens de idioma y difusión pasan por un único transformer compartido, por lo que el modelo lee su propia arquitectura desde el checkpoint.
| Modelo | Tamaño | Destacados |
|---|---|---|
| Cosmos3-Edge | 4B | Texto-a-vídeo, imagen-a-vídeo, generación condicionada por acciones (backbone denso Nemotron) |
| Cosmos3-Nano | 16B | Omnimodal: texto, imagen, vídeo, audio + acciones |
| Cosmos3-Super | 64B | Modelo omnimodal más grande |
| Cosmos3-Super-Image2Video-4Step | 64B | Destilado con DMD2, imagen-a-vídeo en 4 pasos |
| Cosmos3-Super-Text2Image-4Step | 64B | Destilado con DMD2, texto-a-imagen en 4 pasos |
Cosmos3-Edge admite entradas de texto e imagen a 256p y 480p con relaciones de aspecto 16:9, 4:3, 1:1, 3:4 y 9:16, y su acondicionamiento por acciones funciona en distintas plataformas robóticas, como brazos Franka Panda, vehículos autónomos, drones y trayectorias de cámara. Las salidas que se muestran a continuación presentan la generación de audio-vídeo condicionada por acciones de la tarjeta del modelo:
Soporte de ComfyUI
Cosmos3 no forma parte del núcleo de ComfyUI, pero el paquete de nodos de la comunidad ComfyUI-Cosmos3 ofrece soporte para toda la familia Cosmos3, incluido Cosmos3-Edge para texto-a-vídeo e imagen-a-vídeo, a través de la pila integrada KSampler / SamplerCustomAdvanced:
- Clona
ComfyUI-Cosmos3enComfyUI/custom_nodes/e instala surequirements.txt - Descarga un checkpoint (p. ej.
nvidia/Cosmos3-Edge) enComfyUI/models/cosmos3/<name>/; el cargador lee la arquitectura desdetransformer/config.json, por lo que no se necesita configuración manual - Muestrea con el programa de flow-matching
uni_pc_bh2; la torre de texto se rellena previamente una vez por prompt y su K/V se reutiliza en todos los pasos de denoising
El paquete incluye flujos de trabajo de ejemplo para texto-a-vídeo, imagen-a-vídeo, audio-vídeo conjunto y los checkpoints destilados Super de 4 pasos:
Disponibilidad
Los pesos están abiertos en Hugging Face, con la colección de modelos en huggingface.co/collections/nvidia/cosmos3. El código oficial de inferencia y entrenamiento se encuentra en el Repositorio de NVIDIA Cosmos y en el Cosmos Framework, y el informe técnico está en la página de investigación de Cosmos 3.
Comentarios
Inicia sesión con GitHub para unirte a la conversación.